Una card del titolo generata che recita 'Intern-Decision-4B vs ContextPilot-8B', con sottotitolo 'uno rifiuta il contesto lungo, l'altro lo gestisce', con tre chip che recitano 'nessuna valutazione indipendente per nessuno dei due', 'entrambi rilasciati senza un annuncio' e 'nessuno dei due è instradabile oggi'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Engineering & Research

Intern-Decision-4B vs ContextPilot-8B: un modello che comprime il contesto contro un modello che lo gestisce

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Scegli il tuo veleno: internlm/Intern-Decision-4B si rifiuta di leggere più di 8.192 token, e tencent/ContextPilot-8B esiste specificamente per sopravvivere a contesti che crescono senza limite. Sono della stessa classe dimensionale, entrambi fine-tune di una base Qwen, e entrambi sono comparsi sull'Hub senza alcun annuncio del fornitore e senza alcuna valutazione indipendente di alcun tipo — ContextPilot-8B il 27 agosto 2026, Intern-Decision-4B il 26 settembre 2026 — e risolvono problemi opposti. Intern-Decision-4B è un modello di decisione strutturato da 4,5 miliardi di parametri che esegue un singolo forward pass, legge i logits e restituisce una probabilità calibrata per ogni domanda che hai posto; non scrive mai un token. ContextPilot-8B è un generatore di testo da 8,19 miliardi di parametri addestrato a pianificare, ricordare e scaricare il proprio contesto di lavoro durante una lunga esecuzione di un agente. Confrontarli non è davvero una questione di benchmark. È una questione di quale metà del tuo problema preferiresti che il modello inghiottisse.

Prima, la cosa che condividono davvero

Nessuno dei due modelli ha un singolo numero che qualcuno al di fuori del proprio laboratorio abbia verificato. È abbastanza insolito da affermarlo prima di ogni altra cosa, perché la maggior parte dei confronti su questo blog può almeno contare su una classifica indipendente per una delle due parti.

Intern-Decision-4B pubblica una tabella di valutazione completa sulla sua card — una media di 90,02 su sette set, un Brier score di 0,347 e un expected calibration error di 0,065 — il tutto misurato da InternLM sull'harness di InternLM. ContextPilot-8B non pubblica alcuna tabella. La sua card afferma che il framework «supera costantemente i baseline esistenti su vari modelli di base e benchmark» e rimanda a un paper e a una pipeline di valutazione per i dettagli. Quindi, per questo confronto, la riga onesta sulle fonti è breve: una parte è riportata dal fornitore e non riprodotta, l'altra è asserita dal fornitore e non pubblicata, e nulla in questa pagina è indipendente.

A screenshot of the tencent/ContextPilot-8B model card on Hugging Face, showing the paper, live demo, GitHub and models badges, the description of ContextPilot as a proactive context-management framework built on Qwen3-8B, the three listed components, and the loading snippet alongside the note that loading the checkpoint alone does not execute the context-management tools and that the tool definitions and agent runtime are provided separately.

Le due scommesse, dette chiaramente

La scommessa di Intern-Decision-4B è che la parte difficile di una decisione non sia il ragionamento, bensì l'impegnarsi. Dagli uno stato, uno schema di domande denominate e fino a otto immagini, e restituisce una distribuzione sulle tue stesse stringhe di opzioni. La procedura di inferenza è deterministica e a forma fissa: mappa le opzioni su simboli a token singolo, genera uno scheletro JSON di assistente con un segnaposto per campo, esegue un singolo passaggio forward causale, legge i logit immediatamente prima di ciascun segnaposto, applica softmax solo sui candidati di quel campo, applica la temperatura fittata. Non c'è alcun ciclo di decodifica, quindi non c'è parser né superficie di allucinazione da testo libero. Il prezzo di quella scommessa è un tetto rigido per gli input — la scheda dice che gli input superiori a DecisionEngine(max_length=8192) vengono "rifiutati senza troncamento".

La scommessa di ContextPilot-8B è l'immagine speculare: mantenere l'agente che scrive token, ma insegnargli a modificare ciò che sta trasportando. Aggiunge pianificazione, memoria a lungo termine strutturata, recupero e offloading soft del contesto al set di strumenti dell'agente, poi addestra il checkpoint con una ricetta RL che campiona rami attorno alle decisioni di modifica del contesto che contano e assegna credito a livello di azione piuttosto che a livello di traiettoria. La scheda è schietta sulla conseguenza del packaging: caricare il checkpoint non ti fornisce la gestione del contesto. Le definizioni degli strumenti, il runtime dell'agente e la pipeline di valutazione risiedono altrove e devono essere portati con sé.

Tabellone, dimensione per dimensione

• Output — Intern-Decision-4B non emette alcun testo, solo probabilità sui valori delle tue opzioni; ContextPilot-8B genera normalmente e le sue risposte sono prosa e chiamate a strumenti che devi analizzare.

• Limite di input — Intern-Decision-4B rifiuta qualsiasi cosa oltre 8.192 token; ContextPilot-8B eredita il limite di posizione di 40.960 token di Qwen3-8B ed è progettato per continuare a funzionare mentre il contesto effettivo cresce.

• Parametri — 4,54B BF16 per Intern-Decision-4B, distribuiti tra un text tower, un vision tower e un projector; 8,19B BF16 per ContextPilot-8B, un semplice modello linguistico causale Qwen3 denso.

• Latenza — Intern-Decision-4B gira a 44,16 ms di media e 44,60 ms al P95 su una singola RTX 4090, secondo la sua scheda del modello; ContextPilot-8B non pubblica alcun valore di latenza, e il suo costo è fondamentalmente diverso perché genera token anziché assegnare loro un punteggio.

• Immagini — Intern-Decision-4B ne accetta fino a otto, e i token delle immagini contano ai fini del tetto di 8.192; la scheda di ContextPilot-8B descrive un checkpoint di generazione testuale senza alcun percorso multimodale.

• Licenza — Intern-Decision-4B è Apache-2.0 con la licenza Qwen upstream preservata accanto; la licenza di ContextPilot-8B si apre con la Sezione 0, "resa disponibile esclusivamente ai fini della ricerca e dello sviluppo scientifici. Non potrai utilizzarla per nessun altro scopo."

• Evidenza pubblicata — una tabella a sette set con diagnostiche di calibrazione da un lato; un abstract di un articolo e un riferimento a un repository di valutazione dall'altro.

• Storico — entrambi silenziosi. Intern-Decision-4B mostra un like e zero download dal 26 settembre 2026; ContextPilot-8B ha 11 like e circa mille download dal 27 agosto 2026, il che significa più attenzione ma ancora nessuna valutazione di terze parti.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs ContextPilot-8B'. The left column reads: Output: no text, probabilities only; Input ceiling: 8,192 tokens, rejected not truncated; Parameters: 4.54B BF16; Latency: 44.16 ms mean on one RTX 4090; Images: up to eight; License: Apache-2.0. The right column reads: Output: generated text and tool calls; Input ceiling: 40,960-token position limit; Parameters: 8.19B BF16; Latency: not published; Images: none; License: research and development only. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.

Dove ognuno si rompe davvero

La modalità di fallimento di Intern-Decision-4B è strutturale, e vale la pena essere concreti al riguardo. Se le prove a sostegno di una decisione non rientrano in 8.192 token, il modello non si degrada in modo graduale: rifiuta la richiesta. È una scelta ingegneristica difendibile e un adattamento pessimo per esattamente il carico di lavoro per cui è stato costruito ContextPilot-8B. La configurazione stessa della scheda rende la tensione più netta: la torre di testo sotto il wrapper dichiara un limite di posizione di 262.144 token. La backbone può indirizzare un quarto di milione di token e il wrapper rilasciato non ne accetterà più di ottomila.

La modalità di fallimento di ContextPilot-8B è che non è un componente sostituibile senza modifiche per alcunché. È un checkpoint all’interno di un framework, e il framework è il luogo in cui risiede il comportamento. Se estrai i pesi senza le definizioni degli strumenti e il runtime dell’agente, ottieni un fine-tuning di Qwen3-8B la cui capacità distintiva è inerte. Aggiungi a ciò la Sezione 0 della licenza, e la risposta pratica per una distribuzione commerciale è che non puoi usarlo affatto così com’è fornito — il che significa anche che non è una strada candidata per noi, né ora né a breve.

Distribuendo ciascuno, se avessi intenzione di farlo

Intern-Decision-4B vuole una piccola GPU e nessuno stack di serving degno di questo nome: installare PyTorch 2.9.1 e Transformers 5.14.1 con Python 3.12, caricare i quattro shard una sola volta, mantenere il motore residente ed eseguire lo scoring. Poiché il forward pass è a forma fissa, P50 e P95 distano tra loro meno di sei decimi di millisecondo, quindi la pianificazione della capacità riguarda la concorrenza più che la latenza di coda. La parte scomoda è che viene distribuito come classe Python importabile anziché come servizio HTTP, quindi metterlo davanti a un chiamante di produzione significa incapsularlo da soli.

ContextPilot-8B richiede il trattamento opposto: un vero percorso di serving, un esecutore di strumenti, archivi di memoria e un ambiente di rollout in grado di gestire branch, se mai intendi riaddestrarlo o valutarlo come progettato. Non è un modello da provare in un pomeriggio; è un framework di ricerca che si adotta.

Un router aiuta qui?

In parte, e la versione onesta è più ristretta del solito. OrcaRouter non elenca Intern-Decision-4B, ContextPilot-8B né alcun checkpoint comparabile di decision-scoring nel suo catalogo: le nostre pagine dei modelli restituiscono 404 per entrambi, e nulla in questo articolo va letto come un'affermazione di disponibilità. Ciò che un endpoint unificato ti offre davvero è la possibilità di mettere un esperimento fallito dietro un fallback: una sola chiave per oltre 200 modelli, il prezzo di listino del provider passato con 0% di markup, e failover automatico, così che uno scorer che stai ancora valutando non diventi mai un singolo punto di guasto. Questo è un vantaggio reale per il lato Intern-Decision di questo confronto, dove il modello gira davvero a basso costo e in locale. Per ContextPilot-8B è irrilevante, perché una licenza riservata esclusivamente a ricerca e sviluppo esclude una via commerciale a prescindere da ciò che qualsiasi router supporta.

Quale, allora?

Se la tua domanda ha un insieme chiuso di risposte, arriva con le prove allegate e richiede una probabilità anziché una spiegazione, Intern-Decision-4B è l'oggetto più interessante — economico, a forma fissa, calibrato per costruzione e onesto riguardo all'input che non accetterà. Se il tuo problema è che le prove non smettono di arrivare, nessun valutatore di decisioni ti aiuterà e ContextPilot-8B è puntato sul bersaglio giusto, con l'avvertenza che stai adottando un framework e una licenza di ricerca anziché un modello.

Ciò che risolverebbe la questione è un test che nessuno dei due fornitori ha eseguito: sottoporre a entrambi la stessa decisione breve e strutturata, con la risposta calcolabile dallo stato, e vedere se la media di 90,02 dello scorer regge al di fuori del suo stesso harness. Finché qualcuno non lo farà, la lettura corretta di questo confronto è che i due modelli non competono affatto per lo stesso posto.

A generated two-bet card titled 'Same size class, opposite bets'. The left card, 'Intern-Decision-4B — shrink the answer', lists: input ceiling 8,192 tokens, rejected not truncated; output probabilities over your option values; one forward pass, 44.16 ms mean on one RTX 4090; no text, so nothing to parse. The right card, 'ContextPilot-8B — manage the growing context', lists: inherits Qwen3-8B's 40,960-token position limit; generates text and tool calls; context planned, remembered and offloaded during the run; needs the tool definitions and agent runtime to work at all. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.