Una tarjeta de título generada para Intern-Decision-4B, subtitulada «un modelo de decisión estructurado que responde sin escribir un token», con tres chips que dicen «sin anuncio», «tres puntos de control en 40 segundos» y «sin evaluaciones independientes», y con un pie de página que dice «Cifras según la tarjeta del modelo InternLM; nada de esto se reproduce de forma independiente». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Intern-Decision-4B: InternLM lanzó un modelo de decisión que responde sin escribir un token

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Tres repositorios de modelos aparecieron en la página de Hugging Face de InternLM en cuarenta segundos el 26 de septiembre de 2026: Intern-Decision-0.8B a las 05:35:57 UTC, Intern-Decision-2B a las 05:36:19, y internlm/Intern-Decision-4B a las 05:36:37. El 4B es el interesante. Es un ajuste fino de Qwen3.5-4B que acepta un estado compartido, un esquema de preguntas con nombre, e imágenes opcionales, y devuelve una distribución de respuestas calibrada para cada pregunta en una sola pasada hacia adelante. Nunca genera texto. Sus propias notas de la versión lo dicen sin rodeos: "Esta API realiza una puntuación estructurada de candidatos. No llama a generate() o muestrea texto libre." Cuarenta segundos de subidas y ni una sola línea de anuncio en ninguna parte — ni entrada de blog, ni tuit, ni registro de cambios, ni página de lanzamiento. Lo que existe es una tarjeta de modelo, un inference.py, y cuatro fragmentos de safetensors.

A screenshot of the internlm organisation page on Hugging Face, showing the organisation's Recent Activity feed with the Intern-Decision-2B repository listed as published about an hour before the capture, above the organisation's model list and its 18 collections.

Qué se lanzó y qué no

La familia es lo primero que hay que hacer bien, porque la tarjeta del 4B la incluye discretamente. Su tabla de benchmarks publica filas para Intern-Decision-0.8B e Intern-Decision-2B junto con la suya propia, y los tres checkpoints llegaron al hub en el mismo minuto. El repositorio del 2B nunca se enlaza desde la tarjeta del 4B: tienes que encontrarlo a través del feed de subidas de la organización.

Lo que no se lanzó es casi todo lo que normalmente trae un lanzamiento:

• Sin anuncio — cero cobertura en la web, ninguna declaración del proveedor en ningún idioma que hayamos podido encontrar.

• Sin demo — la ficha enlaza un Space en huggingface.co/spaces/internlm/intern-decision; ese endpoint responde HTTP 401, lo que significa que no es público, no que esté roto.

• Ninguna colección: la colección de modelos anunciada en huggingface.co/collections/internlm/intern-decision también devuelve 401.

• No hay repositorio de código: el enlace de GitHub de la tarjeta, github.com/internlm/Intern-Decision, devuelve un error 404, y la lista de repositorios de la organización InternLM no contiene ningún proyecto de ese tipo.

• Sin adopción — al momento de escribir esto, el 4B muestra un me gusta y cero descargas.

Esa es toda la superficie conocible. Trata cada número a continuación como propio del proveedor, porque nadie más ha ejecutado esto todavía.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face, showing the model title, the Demo, Model Weights and GitHub links, the description naming Qwen3.5-4B as the base model, and the five-step 'How inference works' list describing single-token symbol mapping, the assistant JSON skeleton, one causal forward pass, a softmax over candidate-symbol logits, and probability calibration.

El contrato de inferencia es el producto

La mayor parte de la tarjeta se dedica a un procedimiento de cinco pasos, que te dice dónde se puso la ingeniería. Las preguntas y las opciones mantienen su orden. Las opciones de cada pregunta se asignan a símbolos de un solo token — A hasta Z, luego a hasta z, luego 0 hasta 9. Eso son 62 símbolos, y es exactamente por lo que la tarjeta limita una pregunta a 62 opciones. El prompt se genera a partir del prompt del sistema original, el estado, el esquema de decisión y un esqueleto JSON de asistente completo con un <decision> marcador de posición por campo, manteniendo la plantilla de chat del checkpoint y un bloque de pensamiento vacío. Luego, una pasada forward causal. Los logits se leen en la posición inmediatamente anterior a cada marcador de posición, se ejecuta un softmax solo sobre los logits de los símbolos candidatos permitidos para ese campo, se aplica calibración, y los símbolos se asignan de vuelta a los valores de tus opciones.

La consecuencia es una forma fija: sin bucle de decodificación, sin muestreo, sin analizador, sin superficie de alucinación, y un límite máximo estricto de una decisión por pregunta por pasada. Se admiten tres tipos de pregunta — choice con un mapa ordenado de criterios, score con una lista o un mapa con claves numéricas, y noul, un binario no/sí.

El detalle de la ficha técnica que más importa

La ficha es explícita en que las entradas se "rechazan sin truncamiento" por encima de DecisionEngine(max_length=8192). Al leer eso junto con la configuración, surge algo extraño: la torre de texto subyacente declara max_position_embeddings de 262.144. El backbone puede direccionar un cuarto de millón de tokens; el wrapper publicado rechaza cualquier cosa que supere los 8.192. Este no es un modelo de contexto largo con un valor predeterminado conservador: es un modelo de puntuación de decisiones cuyo propio arnés limita la evidencia que puedes darle. Si tu pregunta de enrutamiento depende de más de unos ocho mil tokens de estado, este checkpoint tal como se distribuye no la responderá, y se negará en lugar de recortar tu entrada.

Se permiten hasta ocho imágenes, y la tarjeta señala que los tokens de imagen cuentan dentro de ese mismo límite de 8.192.

A generated timeline card titled 'Three checkpoints, forty seconds', listing Intern-Decision-0.8B at 05:35:57 UTC, Intern-Decision-2B at 05:36:19 UTC and Intern-Decision-4B at 05:36:37 UTC on 26 September 2026, with a footer reading 'Upload timestamps from the InternLM organisation feed on Hugging Face. No announcement accompanied any of the three.' The OrcaRouter logo is composited in the bottom-right corner.

Dentro de los pesos

Cuatro fragmentos, 4,54 mil millones de parámetros BF16 y una configuración que explica el nombre del tamaño: hay una torre de texto, una torre de visión de aproximadamente dos docenas de capas con un tamaño de parche de 16 píxeles, y un proyector entre ellas. El lado del texto tiene 32 capas con un tamaño oculto de 2.560, con 16 cabezas de atención frente a 4 cabezas de clave/valor, un vocabulario de 248.320 tokens y embeddings atados. Los tipos de capa se alternan en un intervalo fijo: tres capas de atención lineal, luego una capa de atención completa, y se repite. Solo las capas de atención completa llevan atención global, y el embedding rotatorio es parcial con un factor de 0,25. Para cargarlo se requiere Python 3.12 o superior, PyTorch 2.9.1 y Transformers 5.14.1, y la lista de archivos todavía incluye el tokenizador y los archivos de merges y vocabulario en lugar de depender de un tokenizador del lado del hub.

Los números, y quién los produjo

Todo en esta sección fue medido por InternLM y publicado en la tarjeta del modelo. Nada de ello ha sido reproducido por un tercero, y no existe ninguna entrada de Artificial Analysis, ninguna calificación de arena ni ninguna fila en una tabla de clasificación para este modelo en ningún lugar.

En siete conjuntos de evaluación, el 4B promedia 90.02, con una puntuación de Brier de 0.347 y un error de calibración esperado de 0.065. La misma tabla incluye Intern-Decision-0.8B con 79.38 e Intern-Decision-2B con 84.68, así que la familia se curva hacia arriba con el tamaño: 4.7 puntos de 0.8B a 2B, y luego 5.3 más hasta 4B. La tabla también contiene cinco filas que el proveedor no entrenó: Jev con 88.74, JevK5 con 85.16, SemIf con 84.23, Kev con 79.56 y Laya con 57.77. Esas las ejecutó InternLM con el harness de InternLM contra el checkpoint de InternLM. No son los números propios de esos proyectos, y leerlos como si lo fueran es el error más fácil de cometer aquí.

La latencia se mide en una única RTX 4090 a través de la ruta local de Hugging Face, y la tarjeta señala que los valores dependen de la carga de trabajo y del hardware. El 4B registra 44,16 ms de media, 44,03 ms de mediana y 44,60 ms en P95 — una dispersión muy inferior a un milisegundo entre la mediana y la cola, que es lo que parece una pasada forward de forma fija. Los dos checkpoints más pequeños rondan ambos los 33 ms, con el 2B ligeramente por delante del 0.8B en la media y la mediana, algo que merece la pena destacar en lugar de pasar por alto: estos dos están lo bastante cerca como para hallarse dentro del ruido de medición entre sí.

Calibración, y las honestas advertencias que contiene

El checkpoint se entrega con una temperatura predeterminada de 1,99241824, ajustada por separado para este modelo mediante minimización de la log-verosimilitud negativa sobre 1728 casos de calibración designados, con 1693 reservados para validación. La ficha indica que las etiquetas de la suite de pruebas no se usaron para elegirla. La implementación es calibración de probabilidad de candidatos, no una temperatura de muestreo: modifica la confianza, la probabilidad binaria y la puntuación esperada, pero deja intacta la decisión argmax.

Un diagnóstico separado de 96 casos reporta entonces el efecto. En las propias columnas de antes y después de InternLM, el Brier y el ECE generales del 4B pasan de 0.628 / 0.213 a 0.550 / 0.089, frente a 0.595 / 0.130 de Jev. Dos lecturas honestas de esa tabla: la calibración claramente funciona, y la columna «antes» no es lo que ningún usuario llegaría a ver, ya que el valor predeterminado que se entrega es la temperatura ajustada. También vale la pena señalar — dos de las seis categorías de diagnóstico son peores para el 4B que para Jev, y la peor de ellas, evidencia diaria y sesgo de observación, mejora a 0.575 / 0.210, aunque sigue por detrás de 0.603 / 0.114 de Jev. En ese segmento, la calibración reduce la brecha sin cerrarla.

Dónde encaja un router y dónde aún no

El obstáculo práctico para usar este modelo no es la precisión, sino el empaquetado. La versión se distribuye como una clase de Python que se importa tras descargar cuatro fragmentos, no como un endpoint HTTP al que puedas llamar. Ese es precisamente el vacío que una capa de enrutamiento existe para cerrar —una sola clave para más de 200 modelos, el precio de lista del proveedor traspasado con un 0 % de margen, y conmutación automática por error cuando un proveedor falla — pero conviene ser francos: OrcaRouter no incluye actualmente Intern-Decision-4B ni ningún modelo de su tipo. Nuestro catálogo no lo lista, y nada de lo que aquí se dice debe interpretarse como una afirmación de disponibilidad. Lo que sí podemos ofrecer es la decisión más económica: si quieres probar un evaluador de decisiones de 4,5 mil millones de parámetros delante de una ruta de producción, puedes integrarlo en un router con un respaldo a un modelo general, de modo que un día de mala calibración te cueste un reintento en lugar de una caída del servicio.

¿Qué cambiaría el panorama?

Tres cosas, por orden de importancia. Alguien de fuera de InternLM tiene que reproducir el 90.02 y el error de calibración esperado de 0.065: las afirmaciones de calibración que no se han enfrentado a un conjunto de pruebas externo son los números menos transferibles del aprendizaje automático. La propia tarjeta tiene que aparecer: el Space, la colección, el repositorio de GitHub. Y el proveedor tiene que decir si esto es un producto o un artefacto de paper, porque una licencia solo para investigación y una licencia Apache-2.0 no son el mismo compromiso, y el 4B eligió Apache-2.0 con la licencia Qwen conservada junto a ella. Hasta entonces, el encuadre correcto es el que la propia subida sugiere: este es un checkpoint real con un contrato de inferencia real y un scorecard completamente sin verificar, publicado sin que nadie fuera informado.

Por ahora, el resumen honesto es acotado y útil. Si tu problema es «elige una de cinco etiquetas de enrutamiento y dime qué tan seguro estás», un modelo de 4,5B que emite 62 logits y nada de prosa es una forma defendible de evaluar. Si tu problema implica un documento largo, más de ocho imágenes o cualquier necesidad de explicar la respuesta con palabras, este checkpoint tal como se entrega es la herramienta equivocada, y ningún grado de pulido en los benchmarks del proveedor cambia eso.