
Intern-Decision-4B vs ContextPilot-8B: Un modelo que reduce el contexto frente a un modelo que lo gestiona
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 592 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Elige tu veneno: internlm/Intern-Decision-4Bse niega a leer más de 8.192 tokens, y tencent/ContextPilot-8Bexiste específicamente para sobrevivir a contextos que crecen sin límite. Son de la misma clase de tamaño, ambos son ajustes finos sobre una base Qwen, y ambos llegaron al Hub sin ningún anuncio del proveedor y sin ninguna evaluación independiente de ningún tipo —ContextPilot-8B el 27 de agosto de 2026, Intern-Decision-4B el 26 de septiembre de 2026—, y resuelven problemas opuestos. Intern-Decision-4B es un modelo de decisión estructurado de 4.500 millones de parámetros que ejecuta una única pasada hacia adelante, lee los logits y devuelve una probabilidad calibrada para cada pregunta que le hiciste; nunca escribe un token. ContextPilot-8B es un generador de texto de 8.190 millones de parámetros entrenado para planificar, recordar y liberar su propio contexto de trabajo durante la ejecución prolongada de un agente. Compararlos no es realmente una cuestión de benchmark. Es una cuestión de qué mitad de tu problema prefieres que el modelo se trague.
Primero, lo que realmente comparten
Ninguno de los dos modelos tiene una sola cifra que alguien ajeno a su propio laboratorio haya verificado. Eso es lo bastante inusual como para mencionarlo antes que nada, porque la mayoría de las comparaciones en este blog pueden al menos apoyarse en una tabla de clasificación independiente para uno de los lados.
Intern-Decision-4B publica una tabla de evaluación completa en su tarjeta —un promedio de 90.02 en siete conjuntos, una puntuación de Brier de 0.347 y un error de calibración esperado de 0.065—, todo medido por InternLM con el harness de InternLM. ContextPilot-8B no publica ninguna tabla en absoluto. Su tarjeta dice que el framework «supera de forma consistente las líneas base existentes en diversos modelos base y benchmarks» y remite a un artículo y a un pipeline de evaluación para los detalles. Así que, para este enfrentamiento, la línea honesta sobre las fuentes es corta: un lado está reportado por el proveedor y no reproducido, el otro está afirmado por el proveedor y no publicado, y nada en esta página es independiente.

Las dos apuestas, planteadas sin rodeos.
La apuesta de Intern-Decision-4B es que la parte difícil de una decisión no es razonar, sino comprometerse. Dale un estado, un esquema de preguntas con nombre y hasta ocho imágenes, y devuelve una distribución sobre tus propias cadenas de opciones. El procedimiento de inferencia es determinista y de forma fija: asignar las opciones a símbolos de un solo token, generar un esqueleto JSON de asistente con un marcador de posición por campo, ejecutar una pasada hacia adelante causal, leer los logits inmediatamente antes de cada marcador de posición, aplicar softmax solo sobre los candidatos de ese campo, aplicar la temperatura ajustada. No hay bucle de decodificación, así que no hay analizador ni superficie de alucinación de texto libre. El precio de esa apuesta es un techo de entrada estricto — la tarjeta dice que las entradas por encima de DecisionEngine(max_length=8192) se rechazan "sin truncamiento".
La apuesta de ContextPilot-8B es la imagen especular: mantener al agente escribiendo tokens, pero enseñarle a editar lo que lleva consigo. Añade planificación, memoria estructurada a largo plazo, recuperación y descarga flexible de contexto al conjunto de herramientas del agente, y luego entrena el checkpoint con una receta de RL que muestrea ramas en torno a las decisiones de edición de contexto que importan y asigna crédito a nivel de acción en lugar de a nivel de trayectoria. La ficha es franca sobre la consecuencia del empaquetado: cargar el checkpoint no te proporciona gestión de contexto. Las definiciones de herramientas, el entorno de ejecución del agente y el pipeline de evaluación viven en otro lugar y hay que traerlos consigo.
Marcador, dimensión por dimensión
• Salida — Intern-Decision-4B no emite ningún texto, solo probabilidades sobre los valores de tus opciones; ContextPilot-8B genera normalmente y sus respuestas son prosa y llamadas a herramientas que tienes que analizar.
• Límite de entrada — Intern-Decision-4B rechaza cualquier entrada que supere los 8.192 tokens; ContextPilot-8B hereda el límite de posición de 40.960 tokens de Qwen3-8B y está diseñado para seguir funcionando a medida que crece el contexto efectivo.
• Parámetros — 4,54B BF16 para Intern-Decision-4B, distribuidos en una torre de texto, una torre de visión y un proyector; 8,19B BF16 para ContextPilot-8B, un modelo de lenguaje causal Qwen3 denso simple.
• Latencia — Intern-Decision-4B se ejecuta en 44,16 ms de media y 44,60 ms en P95 en una sola RTX 4090, según su propia ficha; ContextPilot-8B no publica ninguna cifra de latencia, y su costo es fundamentalmente diferente porque genera tokens en lugar de puntuarlos.
• Imágenes — Intern-Decision-4B admite hasta ocho, y los tokens de imagen cuentan para el límite de 8.192; la ficha de ContextPilot-8B describe un checkpoint de generación de texto sin ruta multimodal.
• Licencia — Intern-Decision-4B es Apache-2.0 con la licencia upstream de Qwen conservada junto a ella; la licencia de ContextPilot-8B comienza con la Sección 0, "se pone a disposición únicamente con el propósito de investigación y desarrollo científicos. No deberá utilizarla para ningún otro propósito."
• Evidencia publicada — una tabla de siete conjuntos con diagnósticos de calibración por un lado; un resumen de artículo y una referencia a un repositorio de evaluación por el otro.
• Historial — ambos discretos. Intern-Decision-4B registra un «me gusta» y cero descargas desde el 26 de septiembre de 2026; ContextPilot-8B tiene 11 «me gusta» y aproximadamente mil descargas desde el 27 de agosto de 2026, lo que supone más atención, pero aún ninguna evaluación de terceros.

Dónde se rompe en realidad cada uno
El modo de fallo de Intern-Decision-4B es estructural, y vale la pena ser concretos al respecto. Si la evidencia para una decisión no cabe en 8.192 tokens, el modelo no se degrada de forma controlada: rechaza la solicitud. Es una decisión de ingeniería defendible y un encaje terrible para exactamente la carga de trabajo para la que se construyó ContextPilot-8B. La propia configuración de la model card agudiza aún más la tensión: la torre de texto bajo el wrapper declara un límite de posición de 262.144 tokens. El backbone puede direccionar un cuarto de millón de tokens y el wrapper publicado no aceptará más de ocho mil.
El modo de fallo de ContextPilot-8B es que no es un reemplazo directo de nada. Es un checkpoint dentro de un framework, y el framework es donde reside el comportamiento. Extrae los pesos sin las definiciones de herramientas y el runtime del agente y tienes un ajuste fino de Qwen3-8B cuya capacidad distintiva es inerte. Súmale a eso la Sección 0 de la licencia, y la respuesta práctica para un despliegue comercial es que no puedes usarlo en absoluto tal como se distribuye — lo que también significa que no es una vía candidata para nosotros, ni ahora ni pronto.
Desplegando cada uno, si fueras a hacerlo
Intern-Decision-4B quiere una GPU pequeña y ningún stack de servicio que merezca su nombre: instalar PyTorch 2.9.1 y Transformers 5.14.1 bajo Python 3.12, cargar los cuatro fragmentos una vez, mantener el motor residente y puntuar. Debido a que el paso forward es de forma fija, P50 y P95 se diferencian en menos de seis décimas de milisegundo, por lo que la planificación de capacidad tiene que ver con la concurrencia en lugar de la latencia de cola. La parte incómoda es que se entrega como una clase de Python importable en lugar de un servicio HTTP, por lo que ponerlo frente a un invocador de producción significa envolverlo tú mismo.
ContextPilot-8B quiere el tratamiento opuesto: una ruta de servicio real, un ejecutor de herramientas, almacenes de memoria y un entorno de despliegue con capacidad de ramificación, si alguna vez pretendes reentrenarlo o evaluarlo tal como fue diseñado. No es un modelo que se prueba en una tarde; es un marco de investigación que adoptas.
¿Ayuda un router aquí?
En parte, y la versión honesta es más limitada de lo habitual. OrcaRouter no incluye Intern-Decision-4B, ContextPilot-8B ni ningún checkpoint comparable de puntuación de decisiones en su catálogo — nuestras páginas de modelos dan 404 para ambos, y nada en este artículo debe interpretarse como una afirmación de disponibilidad. Lo que sí te ofrece un endpoint unificado es la capacidad de poner un experimento fallido detrás de un fallback: una sola clave para más de 200 modelos, el precio de lista del proveedor transferido con un 0% de margen, y conmutación por error automática para que un evaluador que aún estás evaluando nunca se convierta en un punto único de fallo. Eso es un beneficio real para el lado de Intern-Decision en esta comparación, donde el modelo realmente se ejecuta de forma económica y local. Para ContextPilot-8B es irrelevante, porque una licencia exclusiva para investigación y desarrollo descarta cualquier vía comercial independientemente de lo que admita cualquier router.
¿Cuál, entonces?
Si tu pregunta tiene un conjunto cerrado de respuestas, llega con la evidencia adjunta y necesita una probabilidad en lugar de una explicación, Intern-Decision-4B es el objeto más interesante — barato, de forma fija, calibrado por construcción y honesto respecto a la entrada que no aceptará. Si tu problema es que la evidencia no deja de llegar, ningún puntuador de decisiones va a ayudarte y ContextPilot-8B apunta al objetivo correcto, con la advertencia de que estás adoptando un marco y una licencia de investigación en lugar de un modelo.
Lo que zanjaría la cuestión es una prueba que ninguno de los dos proveedores ha ejecutado: entregar a ambos la misma decisión breve y estructurada, con la respuesta calculable a partir del estado, y ver si el promedio de 90.02 del evaluador se sostiene fuera de su propio entorno de evaluación. Hasta que alguien haga eso, la lectura correcta de este enfrentamiento es que los dos modelos no compiten en absoluto por el mismo espacio.

