
Intern-Decision-4B vs ContextPilot-8B: Een model dat de context verkleint tegenover een model dat deze beheert
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 592 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 187 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Kies je vergif: internlm/Intern-Decision-4Bweigert meer dan 8.192 tokens te lezen, en tencent/ContextPilot-8Bbestaat juist om contexten te overleven die onbegrensd groeien. Ze zitten in dezelfde grootteklasse, zijn beide fine-tunes van een Qwen-basis, en zijn beide op de Hub verschenen zonder enige aankondiging van de leverancier en zonder enige onafhankelijke evaluatie van welke aard dan ook — ContextPilot-8B op 27 augustus 2026, Intern-Decision-4B op 26 september 2026 — en ze lossen tegenovergestelde problemen op. Intern-Decision-4B is een gestructureerd beslissingsmodel met 4,5 miljard parameters dat één forward pass uitvoert, logits leest en voor elke vraag die je stelt een gekalibreerde waarschijnlijkheid teruggeeft; het schrijft nooit een token. ContextPilot-8B is een tekstgenerator met 8,19 miljard parameters die is getraind om tijdens een lange agent-run zijn eigen werkcontext te plannen, te onthouden en uit te besteden. Ze vergelijken is niet echt een benchmarkvraag. Het is de vraag welke helft van je probleem je liever door het model laat verzwelgen.
Ten eerste, datgene wat ze echt gemeen hebben
Geen van beide modellen heeft ook maar één cijfer dat iemand buiten het eigen lab heeft geverifieerd. Dat is ongewoon genoeg om vóór alles te vermelden, want de meeste vergelijkingen op deze blog kunnen voor ten minste één kant leunen op een onafhankelijke ranglijst.
Intern-Decision-4B publiceert een volledige evaluatietabel op zijn kaart — een gemiddelde van 90,02 over zeven sets, een Brier-score van 0,347 en een verwachte kalibratiefout van 0,065 — allemaal gemeten door InternLM op de harness van InternLM. ContextPilot-8B publiceert helemaal geen tabel. Op zijn kaart staat dat het framework "consequent beter presteert dan bestaande baselines op verschillende basismodellen en benchmarks" en verwijst voor de details naar een paper en een evaluatiepijplijn. Dus voor deze confrontatie is de eerlijke herkomstregel kort: de ene kant is door de leverancier gerapporteerd en niet gereproduceerd, de andere is door de leverancier beweerd en niet gepubliceerd, en niets op deze pagina is onafhankelijk.

De twee weddenschappen, eenvoudig gesteld
De weddenschap van Intern-Decision-4B is dat het moeilijke deel van een beslissing niet het redeneren is, maar het zich vastleggen. Geef het een toestand, een schema van benoemde vragen en maximaal acht afbeeldingen, en het retourneert een verdeling over je eigen optie-strings. De inferentieprocedure is deterministisch en vormvast: zet opties om naar symbolen van één token, genereer een JSON-skelet voor de assistent met één placeholder per veld, voer één causale forward pass uit, lees de logits direct vóór elke placeholder, neem softmax over alleen de kandidaten van dat veld, pas de gefitte temperatuur toe. Er is geen decoding-lus, dus er is geen parser en geen oppervlak voor hallucinaties in vrije tekst. De prijs van die weddenschap is een harde limiet op de invoer — de kaart zegt dat invoer boven DecisionEngine(max_length=8192) wordt "afgewezen zonder truncatie".
De gok van ContextPilot-8B is het spiegelbeeld: laat de agent tokens blijven schrijven, maar leer hem te bewerken wat hij meedraagt. Het voegt planning, gestructureerd langetermijngeheugen, retrieval en soft context offloading toe aan de gereedschapskist van de agent, en traint vervolgens de checkpoint met een RL-recept dat vertakkingen rond de contextbewerkingsbeslissingen die ertoe doen bemonstert en credit toekent op actieniveau in plaats van op trajectniveau. De kaart is openhartig over de verpakkingsconsequentie: het laden van de checkpoint geeft je geen contextbeheer. De tooldefinities, de agent-runtime en de evaluatiepijplijn bevinden zich elders en moeten worden meegebracht.
Scorebord, dimensie per dimensie
• Uitvoer — Intern-Decision-4B geeft helemaal geen tekst weer, alleen waarschijnlijkheden over de waarden van je opties; ContextPilot-8B genereert normaal en zijn antwoorden zijn proza en tool calls die je moet parsen.
• Invoerplafond — Intern-Decision-4B weigert alles boven 8.192 tokens; ContextPilot-8B erft de positielimiet van 40.960 tokens van Qwen3-8B en is gebouwd om te blijven werken terwijl de effectieve context groeit.
• Parameters — 4,54 miljard BF16 voor Intern-Decision-4B, verdeeld over een teksttoren, een visietoren en een projector; 8,19 miljard BF16 voor ContextPilot-8B, een gewoon dense Qwen3-model voor causale taalmodellering.
• Latentie — Intern-Decision-4B draait op gemiddeld 44,16 ms en 44,60 ms bij P95 op een enkele RTX 4090, volgens zijn eigen kaart; ContextPilot-8B publiceert geen latentiecijfer, en de kosten zijn fundamenteel anders omdat het tokens genereert in plaats van ze te scoren.
• Afbeeldingen — Intern-Decision-4B accepteert er maximaal acht, en beeldtokens tellen mee voor het plafond van 8.192; de kaart van ContextPilot-8B beschrijft een tekstgeneratie-checkpoint zonder multimodaal pad.
• Licentie — Intern-Decision-4B is Apache-2.0, waarbij de upstream Qwen-licentie ernaast bewaard blijft; de licentie van ContextPilot-8B begint met Sectie 0: "uitsluitend beschikbaar gesteld voor wetenschappelijk onderzoek en ontwikkeling. U mag het niet voor enig ander doel gebruiken."
• Gepubliceerd bewijs — aan de ene kant een tabel met zeven sets met kalibratiediagnostiek; aan de andere kant een artikelabstract en een verwijzing naar een evaluatierepository.
• Trackrecord — beide stil. Intern-Decision-4B toont één like en nul downloads sinds 26 september 2026; ContextPilot-8B heeft 11 likes en ongeveer duizend downloads sinds 27 augustus 2026, wat meer is, maar nog steeds evaluatie door derden.

Waar elk ervan daadwerkelijk breekt
De faalmodus van Intern-Decision-4B is structureel, en het loont om daar concreet over te zijn. Als het bewijs voor een beslissing niet in 8.192 tokens past, degradeert het model niet geleidelijk — het verwerpt het verzoek. Dat is een verdedigbare technische keuze en een verschrikkelijk slechte match voor precies de workload waarvoor ContextPilot-8B is gebouwd. De eigen configuratie van de kaart maakt de spanning scherper: de teksttoren onder de wrapper declareert een positielimiet van 262.144 tokens. De backbone kan een kwart miljoen tokens adresseren, en de vrijgegeven wrapper accepteert er niet meer dan achtduizend.
De faalmodus van ContextPilot-8B is dat het geen drop-in-oplossing voor wat dan ook is. Het is een checkpoint binnen een framework, en het framework is waar het gedrag zit. Haal je de gewichten op zonder de tooldefinities en de agent-runtime, dan heb je een Qwen3-8B-fine-tune waarvan het onderscheidende vermogen inert is. Voeg daarbij sectie 0 van de licentie, en het praktische antwoord voor een commerciële implementatie is dat je het in de geleverde staat helemaal niet kunt gebruiken — wat ook betekent dat het voor ons geen kandidaatroute is, nu of binnenkort.
Het inzetten van elk, als je van plan was
Intern-Decision-4B wil een kleine GPU en geen noemenswaardige servingstack: installeer PyTorch 2.9.1 en Transformers 5.14.1 onder Python 3.12, laad de vier shards één keer, houd de engine resident en scoor. Omdat de forward pass een vaste vorm heeft, liggen P50 en P95 binnen zes tienden van een milliseconde van elkaar, dus capaciteitsplanning draait om gelijktijdigheid in plaats van staartlatentie. Het lastige deel is dat het wordt geleverd als een importeerbare Python-klasse in plaats van een HTTP-service, dus om het voor een productieaanroeper te krijgen, moet je het zelf wrappen.
ContextPilot-8B wil de tegenovergestelde behandeling: een echt servingpad, een tool-executor, geheugenopslag en een rollout-omgeving die vertakkingen ondersteunt als je ooit van plan bent om het opnieuw te trainen of te evalueren zoals het is ontworpen. Dit is geen model dat je in een middag uitprobeert; het is een onderzoeksframework dat je omarmt.
Helpt een router hier?
Deels, en de eerlijke versie is beperkter dan gebruikelijk. OrcaRouter vermeldt Intern-Decision-4B, ContextPilot-8B of enig vergelijkbaar checkpoint voor het scoren van beslissingen niet in zijn catalogus — onze modelpagina's geven voor beide een 404, en niets in dit stuk mag worden opgevat als een bewering over beschikbaarheid. Wat een uniform endpoint je wel oplevert, is de mogelijkheid om een mislukt experiment achter een fallback te plaatsen: één sleutel voor meer dan 200 modellen, de adviesprijs van de provider doorgegeven met 0% opslag, en automatische failover, zodat een scorer die je nog aan het evalueren bent nooit een single point of failure wordt. Dat is een reëel voordeel voor de Intern-Decision-kant van deze vergelijking, waar het model daadwerkelijk goedkoop en lokaal draait. Voor ContextPilot-8B is het niet van belang, want een licentie voor uitsluitend onderzoek en ontwikkeling sluit een commerciële route uit, ongeacht wat een router ondersteunt.
Welke dan?
Als je vraag een gesloten verzameling antwoorden heeft, met het bewijs eraan vast aankomt, en een waarschijnlijkheid vereist in plaats van een uitleg, dan is Intern-Decision-4B het interessantere object — goedkoop, met een vaste vorm, door constructie gekalibreerd, en eerlijk over de input die het niet accepteert. Als je probleem is dat het bewijs maar blijft binnenkomen, dan gaat geen enkele beslissingsscorer je helpen en is ContextPilot-8B op het juiste doel gericht, met de kanttekening dat je een framework en een onderzoekslicentie overneemt in plaats van een model.
Wat dit zou beslechten, is een test die geen van beide leveranciers heeft uitgevoerd: geef beide dezelfde korte, gestructureerde beslissing waarvan het antwoord uit de toestand kan worden berekend, en kijk of het gemiddelde van 90,02 van de scorer standhoudt buiten zijn eigen testomgeving. Tot iemand dat doet, is de juiste interpretatie van deze confrontatie dat de twee modellen helemaal niet om dezelfde plek concurreren.

