Ett genererat titelkort med texten 'Intern-Decision-4B vs ContextPilot-8B', med undertexten 'en vägrar lång kontext, en hanterar den', med tre chips med texterna 'inga oberoende utvärderingar för någon av dem', 'båda släpptes utan tillkännagivande' och 'ingen av dem är routbar idag'. OrcaRouter-logotypen är infogad i det nedre högra hörnet.
Engineering & Research

Intern-Decision-4B vs ContextPilot-8B: En modell som krymper kontexten mot en modell som hanterar den

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Välj ditt gift: internlm/Intern-Decision-4B vägrar läsa mer än 8 192 tokens, och tencent/ContextPilot-8B finns specifikt för att överleva kontexter som växer utan gräns. De är i samma storleksklass, båda finjusteringar av en Qwe​n-bas, och båda dök upp på Hubben utan något leverantörsmeddelande och utan någon oberoende utvärdering av något slag — ContextPilot-8B den 27 augusti 2026, Intern-Decision-4B den 26 september 2026 — och de löser motsatta problem. Intern-Decision-4B är en strukturerad beslutsmodell med 4,5 miljarder parametrar som kör en framåtpassning, läser logits och returnerar en kalibrerad sannolikhet för varje fråga du ställde; den skriver aldrig en token. ContextPilot-8B är en textgenerator med 8,19 miljarder parametrar som tränats att planera, komma ihåg och avlasta sin egen arbetskontext under en lång agentkörning. Att jämföra dem är egentligen inte en benchmarkfråga. Det är en fråga om vilken halva av ditt problem du helst vill att modellen sväljer.

Först, det de verkligen har gemensamt

Ingen av modellerna har ett enda tal som någon utanför dess eget labb har verifierat. Det är ovanligt nog att nämna före allt annat, eftersom de flesta jämförelser på den här bloggen åtminstone kan luta sig mot en oberoende leaderboard för ena sidan.

Intern-Decision-4B publicerar en fullständig utvärderingstabell på sitt modellkort – ett genomsnitt på 90,02 över sju uppsättningar, en Brier-poäng på 0,347 och ett förväntat kalibreringsfel på 0,065 – allt mätt av InternLM i InternLMs eget utvärderingsramverk. ContextPilot-8B publicerar ingen tabell alls. Dess modellkort säger att ramverket ”konsekvent överträffar befintliga baslinjer över olika basmodeller och benchmarks” och hänvisar till en artikel och en utvärderingspipeline för närmare detaljer. Så för den här jämförelsen är den ärliga källhänvisningen kort: den ena sidan är rapporterad av leverantören och inte reproducerad, den andra är påstådd av leverantören och opublicerad, och inget på den här sidan är oberoende.

A screenshot of the tencent/ContextPilot-8B model card on Hugging Face, showing the paper, live demo, GitHub and models badges, the description of ContextPilot as a proactive context-management framework built on Qwen3-8B, the three listed components, and the loading snippet alongside the note that loading the checkpoint alone does not execute the context-management tools and that the tool definitions and agent runtime are provided separately.

De två satsningarna, uttryckta i klartext

Intern-Decision-4B:s satsning är att det svåra med ett beslut inte är resonemanget, utan att förbinda sig. Ge den ett tillstånd, ett schema med namngivna frågor och upp till åtta bilder, och den returnerar en fördelning över dina egna alternativsträngar. Inferensproceduren är deterministisk och formlåst: mappa alternativ till symboler med en enda token, rendera ett JSON-skelett för assistenten med en platshållare per fält, kör en enda kausal framåtpassning, läs logits omedelbart före varje platshållare, softmax över endast det fältets kandidater, tillämpa den anpassade temperaturen. Det finns ingen avkodningsloop, så det finns ingen parser och ingen yta för hallucinationer i fritext. Priset för den satsningen är ett hårt tak för indata – kortet säger att indata över DecisionEngine(max_length=8192) "avvisas utan trunkering".

ContextPilot-8B:s satsning är spegelbilden: låt agenten fortsätta skriva tokens, men lär den att redigera det den bär på. Den lägger till planering, strukturerat långtidsminne, hämtning och mjuk kontextavlastning i agentens verktygsuppsättning och tränar sedan checkpointen med ett RL-recept som samplar grenar kring de kontextredigeringsbeslut som spelar roll och tilldelar kredit på handlingsnivå i stället för på trajektorienivå. Kortet är uppriktigt om paketeringskonsekvensen: att ladda checkpointen ger dig inte kontexthantering. Verktygsdefinitionerna, agentens runtime och utvärderingspipelinen finns någon annanstans och måste tas med.

Resultattavla, dimension för dimension

• Utdata — Intern-Decision-4B avger ingen text alls, endast sannolikheter över dina alternativvärden; ContextPilot-8B genererar normalt och dess svar är prosa och verktygsanrop som du måste tolka.

• Indatatak — Intern-Decision-4B avvisar allt över 8 192 tokens; ContextPilot-8B ärver Qwen3-8B:s positionsgräns på 40 960 tokens och är byggd för att fortsätta fungera medan den effektiva kontexten växer.

• Parametrar – 4,54B BF16 för Intern-Decision-4B, fördelat över ett texttorn, ett visionstorn och en projektor; 8,19B BF16 för ContextPilot-8B, en vanlig tät Qwen3 kausal språkmodell.

• Latens — Intern-Decision-4B kör i genomsnitt 44,16 ms och 44,60 ms vid P95 på ett enda RTX 4090, enligt dess eget modellkort; ContextPilot-8B publicerar ingen latenssiffra, och dess kostnad är i grunden annorlunda eftersom den genererar tokens i stället för att poängsätta dem.

• Bilder — Intern-Decision-4B tar emot upp till åtta, och bildtoken räknas mot taket på 8 192; ContextPilot-8B:s modellkort beskriver en checkpoint för textgenerering som saknar multimodal väg.

• Licens — Intern-Decision-4B är Apache-2.0 med den uppströms Qwen-licensen bevarad bredvid; ContextPilot-8B:s licens inleds med avsnitt 0, "tillhandahålls uteslutande i syfte att bedriva vetenskaplig forskning och utveckling. Du får inte använda den för något annat ändamål."

• Publicerade belägg — en tabell över sju uppsättningar med kalibreringsdiagnostik på ena sidan; ett artikelabstract och en hänvisning till ett utvärderingsarkiv på den andra.

• Meritlista — båda tysta. Intern-Decision-4B visar en gillamarkering och noll nedladdningar sedan den 26 september 2026; ContextPilot-8B har 11 gillamarkeringar och ungefär tusen nedladdningar sedan den 27 augusti 2026, vilket är mer uppmärksamhet men fortfarande ingen tredjepartsutvärdering.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs ContextPilot-8B'. The left column reads: Output: no text, probabilities only; Input ceiling: 8,192 tokens, rejected not truncated; Parameters: 4.54B BF16; Latency: 44.16 ms mean on one RTX 4090; Images: up to eight; License: Apache-2.0. The right column reads: Output: generated text and tool calls; Input ceiling: 40,960-token position limit; Parameters: 8.19B BF16; Latency: not published; Images: none; License: research and development only. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.

Där var och en faktiskt går sönder

Intern-Decision-4B:s felmod är strukturell, och det är värt att vara konkret om den. Om bevisningen för ett beslut inte får plats i 8 192 token försämras inte modellen gradvis – den avvisar begäran. Det är ett försvarbart ingenjörsval och en fruktansvärt dålig passning för exakt den arbetsbelastning som ContextPilot-8B byggdes för. Kortets egen konfiguration gör spänningen ännu skarpare: texttornet under wrappern deklarerar en positionsgräns på 262 144 token. Backbonen kan adressera en kvarts miljon token och den släppta wrappern tar inte emot mer än åtta tusen.

ContextPilot-8B:s felmod är att det inte är någon drop-in-lösning alls. Det är en checkpoint i ett ramverk, och det är i ramverket som beteendet finns. Drar du vikterna utan verktygsdefinitionerna och agent-runtime har du en Qwen3-8B-finetuning vars utmärkande förmåga är overksam. Lägg därtill avsnitt 0 i licensen, och det praktiska svaret för en kommersiell driftsättning är att du inte kan använda den alls som den levereras – vilket också innebär att den inte är en tänkbar väg för oss, varken nu eller inom kort.

Driftsätter var och en, om du skulle göra det

Intern-Decision-4B vill ha en liten GPU och ingen serveringsstack värd namnet: installera PyTorch 2.9.1 och Transformers 5.14.1 under Python 3.12, ladda de fyra shardarna en gång, håll motorn resident och poängsätt. Eftersom framåtpassningen har fast form ligger P50 och P95 inom sex tiondels millisekund från varandra, så kapacitetsplanering handlar om samtidighet snarare än svanslatens. Det besvärliga är att den levereras som en importerbar Python-klass i stället för en HTTP-tjänst, så att få den framför en produktionsanropare innebär att du själv måste wrappa den.

ContextPilot-8B vill ha den motsatta behandlingen: en riktig serveringsväg, en verktygsutförare, minneslager och en utrullningsmiljö med grenstöd om du någonsin tänker träna om eller utvärdera den som designad. Det här är inte en modell man testar under en eftermiddag; det är ett forskningsramverk man adopterar.

Hjälper en router här?

Delvis, och den ärliga versionen är snävare än vanligt. OrcaRouter listar inte Intern-Decision-4B, ContextPilot-8B eller någon jämförbar checkpoint för beslutsbedömning i sin katalog – våra modellsidor ger 404 för båda, och inget i den här artikeln bör läsas som ett påstående om tillgänglighet. Vad en enhetlig endpoint faktiskt ger dig är möjligheten att lägga ett misslyckat experiment bakom en fallback: en nyckel över 200+ modeller, leverantörens listpris vidarebefordrat med 0 % påslag, och automatisk failover så att en scorer du fortfarande utvärderar aldrig blir en enda felpunkt. Det är en verklig fördel för Intern-Decision-sidan av den här jämförelsen, där modellen faktiskt körs billigt och lokalt. För ContextPilot-8B är det irrelevant, eftersom en licens som endast tillåter forskning och utveckling utesluter en kommersiell väg oavsett vad någon router stöder.

Vilken då?

Om din fråga har en sluten uppsättning svar, kommer med bevisningen bifogad och behöver en sannolikhet snarare än en förklaring, är Intern-Decision-4B det mer intressanta objektet – billigt, med fast form, kalibrerat genom konstruktion och ärligt om vilken indata det inte accepterar. Om ditt problem är att bevisningen inte slutar komma, kommer ingen beslutsbedömare att hjälpa dig, och ContextPilot-8B siktar på rätt mål, med förbehållet att du antar ett ramverk och en forskningslicens snarare än en modell.

Det som skulle avgöra saken är ett race som ingen av dem har kört: ge båda samma korta, strukturerade uppgift med ett svar som kan beräknas utifrån tillståndet, och se om bedömarens genomsnitt på 90 % håller utanför sin egen testmiljö. Tills någon gör det är den korrekta tolkningen av den här matchningen att de två modellerna inte alls tävlar om samma plats.

A generated two-bet card titled 'Same size class, opposite bets'. The left card, 'Intern-Decision-4B — shrink the answer', lists: input ceiling 8,192 tokens, rejected not truncated; output probabilities over your option values; one forward pass, 44.16 ms mean on one RTX 4090; no text, so nothing to parse. The right card, 'ContextPilot-8B — manage the growing context', lists: inherits Qwen3-8B's 40,960-token position limit; generates text and tool calls; context planned, remembered and offloaded during the run; needs the tool definitions and agent runtime to work at all. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.