
Intern-Decision-4B vs ContextPilot-8B: un modello che comprime il contesto contro un modello che lo gestisce
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 592 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 187 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Scegli il tuo veleno: internlm/Intern-Decision-4B si rifiuta di leggere più di 8.192 token, e tencent/ContextPilot-8B esiste specificamente per sopravvivere a contesti che crescono senza limite. Sono della stessa classe dimensionale, entrambi fine-tune di una base Qwen, e entrambi sono comparsi sull'Hub senza alcun annuncio del fornitore e senza alcuna valutazione indipendente di alcun tipo — ContextPilot-8B il 27 agosto 2026, Intern-Decision-4B il 26 settembre 2026 — e risolvono problemi opposti. Intern-Decision-4B è un modello di decisione strutturato da 4,5 miliardi di parametri che esegue un singolo forward pass, legge i logits e restituisce una probabilità calibrata per ogni domanda che hai posto; non scrive mai un token. ContextPilot-8B è un generatore di testo da 8,19 miliardi di parametri addestrato a pianificare, ricordare e scaricare il proprio contesto di lavoro durante una lunga esecuzione di un agente. Confrontarli non è davvero una questione di benchmark. È una questione di quale metà del tuo problema preferiresti che il modello inghiottisse.
Prima, la cosa che condividono davvero
Nessuno dei due modelli ha un singolo numero che qualcuno al di fuori del proprio laboratorio abbia verificato. È abbastanza insolito da affermarlo prima di ogni altra cosa, perché la maggior parte dei confronti su questo blog può almeno contare su una classifica indipendente per una delle due parti.
Intern-Decision-4B pubblica una tabella di valutazione completa sulla sua card — una media di 90,02 su sette set, un Brier score di 0,347 e un expected calibration error di 0,065 — il tutto misurato da InternLM sull'harness di InternLM. ContextPilot-8B non pubblica alcuna tabella. La sua card afferma che il framework «supera costantemente i baseline esistenti su vari modelli di base e benchmark» e rimanda a un paper e a una pipeline di valutazione per i dettagli. Quindi, per questo confronto, la riga onesta sulle fonti è breve: una parte è riportata dal fornitore e non riprodotta, l'altra è asserita dal fornitore e non pubblicata, e nulla in questa pagina è indipendente.

Le due scommesse, dette chiaramente
La scommessa di Intern-Decision-4B è che la parte difficile di una decisione non sia il ragionamento, bensì l'impegnarsi. Dagli uno stato, uno schema di domande denominate e fino a otto immagini, e restituisce una distribuzione sulle tue stesse stringhe di opzioni. La procedura di inferenza è deterministica e a forma fissa: mappa le opzioni su simboli a token singolo, genera uno scheletro JSON di assistente con un segnaposto per campo, esegue un singolo passaggio forward causale, legge i logit immediatamente prima di ciascun segnaposto, applica softmax solo sui candidati di quel campo, applica la temperatura fittata. Non c'è alcun ciclo di decodifica, quindi non c'è parser né superficie di allucinazione da testo libero. Il prezzo di quella scommessa è un tetto rigido per gli input — la scheda dice che gli input superiori a DecisionEngine(max_length=8192) vengono "rifiutati senza troncamento".
La scommessa di ContextPilot-8B è l'immagine speculare: mantenere l'agente che scrive token, ma insegnargli a modificare ciò che sta trasportando. Aggiunge pianificazione, memoria a lungo termine strutturata, recupero e offloading soft del contesto al set di strumenti dell'agente, poi addestra il checkpoint con una ricetta RL che campiona rami attorno alle decisioni di modifica del contesto che contano e assegna credito a livello di azione piuttosto che a livello di traiettoria. La scheda è schietta sulla conseguenza del packaging: caricare il checkpoint non ti fornisce la gestione del contesto. Le definizioni degli strumenti, il runtime dell'agente e la pipeline di valutazione risiedono altrove e devono essere portati con sé.
Tabellone, dimensione per dimensione
• Output — Intern-Decision-4B non emette alcun testo, solo probabilità sui valori delle tue opzioni; ContextPilot-8B genera normalmente e le sue risposte sono prosa e chiamate a strumenti che devi analizzare.
• Limite di input — Intern-Decision-4B rifiuta qualsiasi cosa oltre 8.192 token; ContextPilot-8B eredita il limite di posizione di 40.960 token di Qwen3-8B ed è progettato per continuare a funzionare mentre il contesto effettivo cresce.
• Parametri — 4,54B BF16 per Intern-Decision-4B, distribuiti tra un text tower, un vision tower e un projector; 8,19B BF16 per ContextPilot-8B, un semplice modello linguistico causale Qwen3 denso.
• Latenza — Intern-Decision-4B gira a 44,16 ms di media e 44,60 ms al P95 su una singola RTX 4090, secondo la sua scheda del modello; ContextPilot-8B non pubblica alcun valore di latenza, e il suo costo è fondamentalmente diverso perché genera token anziché assegnare loro un punteggio.
• Immagini — Intern-Decision-4B ne accetta fino a otto, e i token delle immagini contano ai fini del tetto di 8.192; la scheda di ContextPilot-8B descrive un checkpoint di generazione testuale senza alcun percorso multimodale.
• Licenza — Intern-Decision-4B è Apache-2.0 con la licenza Qwen upstream preservata accanto; la licenza di ContextPilot-8B si apre con la Sezione 0, "resa disponibile esclusivamente ai fini della ricerca e dello sviluppo scientifici. Non potrai utilizzarla per nessun altro scopo."
• Evidenza pubblicata — una tabella a sette set con diagnostiche di calibrazione da un lato; un abstract di un articolo e un riferimento a un repository di valutazione dall'altro.
• Storico — entrambi silenziosi. Intern-Decision-4B mostra un like e zero download dal 26 settembre 2026; ContextPilot-8B ha 11 like e circa mille download dal 27 agosto 2026, il che significa più attenzione ma ancora nessuna valutazione di terze parti.

Dove ognuno si rompe davvero
La modalità di fallimento di Intern-Decision-4B è strutturale, e vale la pena essere concreti al riguardo. Se le prove a sostegno di una decisione non rientrano in 8.192 token, il modello non si degrada in modo graduale: rifiuta la richiesta. È una scelta ingegneristica difendibile e un adattamento pessimo per esattamente il carico di lavoro per cui è stato costruito ContextPilot-8B. La configurazione stessa della scheda rende la tensione più netta: la torre di testo sotto il wrapper dichiara un limite di posizione di 262.144 token. La backbone può indirizzare un quarto di milione di token e il wrapper rilasciato non ne accetterà più di ottomila.
La modalità di fallimento di ContextPilot-8B è che non è un componente sostituibile senza modifiche per alcunché. È un checkpoint all’interno di un framework, e il framework è il luogo in cui risiede il comportamento. Se estrai i pesi senza le definizioni degli strumenti e il runtime dell’agente, ottieni un fine-tuning di Qwen3-8B la cui capacità distintiva è inerte. Aggiungi a ciò la Sezione 0 della licenza, e la risposta pratica per una distribuzione commerciale è che non puoi usarlo affatto così com’è fornito — il che significa anche che non è una strada candidata per noi, né ora né a breve.
Distribuendo ciascuno, se avessi intenzione di farlo
Intern-Decision-4B vuole una piccola GPU e nessuno stack di serving degno di questo nome: installare PyTorch 2.9.1 e Transformers 5.14.1 con Python 3.12, caricare i quattro shard una sola volta, mantenere il motore residente ed eseguire lo scoring. Poiché il forward pass è a forma fissa, P50 e P95 distano tra loro meno di sei decimi di millisecondo, quindi la pianificazione della capacità riguarda la concorrenza più che la latenza di coda. La parte scomoda è che viene distribuito come classe Python importabile anziché come servizio HTTP, quindi metterlo davanti a un chiamante di produzione significa incapsularlo da soli.
ContextPilot-8B richiede il trattamento opposto: un vero percorso di serving, un esecutore di strumenti, archivi di memoria e un ambiente di rollout in grado di gestire branch, se mai intendi riaddestrarlo o valutarlo come progettato. Non è un modello da provare in un pomeriggio; è un framework di ricerca che si adotta.
Un router aiuta qui?
In parte, e la versione onesta è più ristretta del solito. OrcaRouter non elenca Intern-Decision-4B, ContextPilot-8B né alcun checkpoint comparabile di decision-scoring nel suo catalogo: le nostre pagine dei modelli restituiscono 404 per entrambi, e nulla in questo articolo va letto come un'affermazione di disponibilità. Ciò che un endpoint unificato ti offre davvero è la possibilità di mettere un esperimento fallito dietro un fallback: una sola chiave per oltre 200 modelli, il prezzo di listino del provider passato con 0% di markup, e failover automatico, così che uno scorer che stai ancora valutando non diventi mai un singolo punto di guasto. Questo è un vantaggio reale per il lato Intern-Decision di questo confronto, dove il modello gira davvero a basso costo e in locale. Per ContextPilot-8B è irrilevante, perché una licenza riservata esclusivamente a ricerca e sviluppo esclude una via commerciale a prescindere da ciò che qualsiasi router supporta.
Quale, allora?
Se la tua domanda ha un insieme chiuso di risposte, arriva con le prove allegate e richiede una probabilità anziché una spiegazione, Intern-Decision-4B è l'oggetto più interessante — economico, a forma fissa, calibrato per costruzione e onesto riguardo all'input che non accetterà. Se il tuo problema è che le prove non smettono di arrivare, nessun valutatore di decisioni ti aiuterà e ContextPilot-8B è puntato sul bersaglio giusto, con l'avvertenza che stai adottando un framework e una licenza di ricerca anziché un modello.
Ciò che risolverebbe la questione è un test che nessuno dei due fornitori ha eseguito: sottoporre a entrambi la stessa decisione breve e strutturata, con la risposta calcolabile dallo stato, e vedere se la media di 90,02 dello scorer regge al di fuori del suo stesso harness. Finché qualcuno non lo farà, la lettura corretta di questo confronto è che i due modelli non competono affatto per lo stesso posto.

