
Intern-Decision-4B: InternLM lanzó un modelo de decisión que responde sin escribir un token
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 592 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Tres repositorios de modelos aparecieron en la página de Hugging Face de InternLM en cuarenta segundos el 26 de septiembre de 2026: Intern-Decision-0.8B a las 05:35:57 UTC, Intern-Decision-2B a las 05:36:19, y internlm/Intern-Decision-4B a las 05:36:37. El 4B es el interesante. Es un ajuste fino de Qwen3.5-4B que acepta un estado compartido, un esquema de preguntas con nombre, e imágenes opcionales, y devuelve una distribución de respuestas calibrada para cada pregunta en una sola pasada hacia adelante. Nunca genera texto. Sus propias notas de la versión lo dicen sin rodeos: "Esta API realiza una puntuación estructurada de candidatos. No llama a generate() o muestrea texto libre." Cuarenta segundos de subidas y ni una sola línea de anuncio en ninguna parte — ni entrada de blog, ni tuit, ni registro de cambios, ni página de lanzamiento. Lo que existe es una tarjeta de modelo, un inference.py, y cuatro fragmentos de safetensors.

Qué se lanzó y qué no
La familia es lo primero que hay que hacer bien, porque la tarjeta del 4B la incluye discretamente. Su tabla de benchmarks publica filas para Intern-Decision-0.8B e Intern-Decision-2B junto con la suya propia, y los tres checkpoints llegaron al hub en el mismo minuto. El repositorio del 2B nunca se enlaza desde la tarjeta del 4B: tienes que encontrarlo a través del feed de subidas de la organización.
Lo que no se lanzó es casi todo lo que normalmente trae un lanzamiento:
• Sin anuncio — cero cobertura en la web, ninguna declaración del proveedor en ningún idioma que hayamos podido encontrar.
• Sin demo — la ficha enlaza un Space en huggingface.co/spaces/internlm/intern-decision; ese endpoint responde HTTP 401, lo que significa que no es público, no que esté roto.
• Ninguna colección: la colección de modelos anunciada en huggingface.co/collections/internlm/intern-decision también devuelve 401.
• No hay repositorio de código: el enlace de GitHub de la tarjeta, github.com/internlm/Intern-Decision, devuelve un error 404, y la lista de repositorios de la organización InternLM no contiene ningún proyecto de ese tipo.
• Sin adopción — al momento de escribir esto, el 4B muestra un me gusta y cero descargas.
Esa es toda la superficie conocible. Trata cada número a continuación como propio del proveedor, porque nadie más ha ejecutado esto todavía.

El contrato de inferencia es el producto
La mayor parte de la tarjeta se dedica a un procedimiento de cinco pasos, que te dice dónde se puso la ingeniería. Las preguntas y las opciones mantienen su orden. Las opciones de cada pregunta se asignan a símbolos de un solo token — A hasta Z, luego a hasta z, luego 0 hasta 9. Eso son 62 símbolos, y es exactamente por lo que la tarjeta limita una pregunta a 62 opciones. El prompt se genera a partir del prompt del sistema original, el estado, el esquema de decisión y un esqueleto JSON de asistente completo con un <decision> marcador de posición por campo, manteniendo la plantilla de chat del checkpoint y un bloque de pensamiento vacío. Luego, una pasada forward causal. Los logits se leen en la posición inmediatamente anterior a cada marcador de posición, se ejecuta un softmax solo sobre los logits de los símbolos candidatos permitidos para ese campo, se aplica calibración, y los símbolos se asignan de vuelta a los valores de tus opciones.
La consecuencia es una forma fija: sin bucle de decodificación, sin muestreo, sin analizador, sin superficie de alucinación, y un límite máximo estricto de una decisión por pregunta por pasada. Se admiten tres tipos de pregunta — choice con un mapa ordenado de criterios, score con una lista o un mapa con claves numéricas, y noul, un binario no/sí.
El detalle de la ficha técnica que más importa
La ficha es explícita en que las entradas se "rechazan sin truncamiento" por encima de DecisionEngine(max_length=8192). Al leer eso junto con la configuración, surge algo extraño: la torre de texto subyacente declara max_position_embeddings de 262.144. El backbone puede direccionar un cuarto de millón de tokens; el wrapper publicado rechaza cualquier cosa que supere los 8.192. Este no es un modelo de contexto largo con un valor predeterminado conservador: es un modelo de puntuación de decisiones cuyo propio arnés limita la evidencia que puedes darle. Si tu pregunta de enrutamiento depende de más de unos ocho mil tokens de estado, este checkpoint tal como se distribuye no la responderá, y se negará en lugar de recortar tu entrada.
Se permiten hasta ocho imágenes, y la tarjeta señala que los tokens de imagen cuentan dentro de ese mismo límite de 8.192.

Dentro de los pesos
Cuatro fragmentos, 4,54 mil millones de parámetros BF16 y una configuración que explica el nombre del tamaño: hay una torre de texto, una torre de visión de aproximadamente dos docenas de capas con un tamaño de parche de 16 píxeles, y un proyector entre ellas. El lado del texto tiene 32 capas con un tamaño oculto de 2.560, con 16 cabezas de atención frente a 4 cabezas de clave/valor, un vocabulario de 248.320 tokens y embeddings atados. Los tipos de capa se alternan en un intervalo fijo: tres capas de atención lineal, luego una capa de atención completa, y se repite. Solo las capas de atención completa llevan atención global, y el embedding rotatorio es parcial con un factor de 0,25. Para cargarlo se requiere Python 3.12 o superior, PyTorch 2.9.1 y Transformers 5.14.1, y la lista de archivos todavía incluye el tokenizador y los archivos de merges y vocabulario en lugar de depender de un tokenizador del lado del hub.
Los números, y quién los produjo
Todo en esta sección fue medido por InternLM y publicado en la tarjeta del modelo. Nada de ello ha sido reproducido por un tercero, y no existe ninguna entrada de Artificial Analysis, ninguna calificación de arena ni ninguna fila en una tabla de clasificación para este modelo en ningún lugar.
En siete conjuntos de evaluación, el 4B promedia 90.02, con una puntuación de Brier de 0.347 y un error de calibración esperado de 0.065. La misma tabla incluye Intern-Decision-0.8B con 79.38 e Intern-Decision-2B con 84.68, así que la familia se curva hacia arriba con el tamaño: 4.7 puntos de 0.8B a 2B, y luego 5.3 más hasta 4B. La tabla también contiene cinco filas que el proveedor no entrenó: Jev con 88.74, JevK5 con 85.16, SemIf con 84.23, Kev con 79.56 y Laya con 57.77. Esas las ejecutó InternLM con el harness de InternLM contra el checkpoint de InternLM. No son los números propios de esos proyectos, y leerlos como si lo fueran es el error más fácil de cometer aquí.
La latencia se mide en una única RTX 4090 a través de la ruta local de Hugging Face, y la tarjeta señala que los valores dependen de la carga de trabajo y del hardware. El 4B registra 44,16 ms de media, 44,03 ms de mediana y 44,60 ms en P95 — una dispersión muy inferior a un milisegundo entre la mediana y la cola, que es lo que parece una pasada forward de forma fija. Los dos checkpoints más pequeños rondan ambos los 33 ms, con el 2B ligeramente por delante del 0.8B en la media y la mediana, algo que merece la pena destacar en lugar de pasar por alto: estos dos están lo bastante cerca como para hallarse dentro del ruido de medición entre sí.
Calibración, y las honestas advertencias que contiene
El checkpoint se entrega con una temperatura predeterminada de 1,99241824, ajustada por separado para este modelo mediante minimización de la log-verosimilitud negativa sobre 1728 casos de calibración designados, con 1693 reservados para validación. La ficha indica que las etiquetas de la suite de pruebas no se usaron para elegirla. La implementación es calibración de probabilidad de candidatos, no una temperatura de muestreo: modifica la confianza, la probabilidad binaria y la puntuación esperada, pero deja intacta la decisión argmax.
Un diagnóstico separado de 96 casos reporta entonces el efecto. En las propias columnas de antes y después de InternLM, el Brier y el ECE generales del 4B pasan de 0.628 / 0.213 a 0.550 / 0.089, frente a 0.595 / 0.130 de Jev. Dos lecturas honestas de esa tabla: la calibración claramente funciona, y la columna «antes» no es lo que ningún usuario llegaría a ver, ya que el valor predeterminado que se entrega es la temperatura ajustada. También vale la pena señalar — dos de las seis categorías de diagnóstico son peores para el 4B que para Jev, y la peor de ellas, evidencia diaria y sesgo de observación, mejora a 0.575 / 0.210, aunque sigue por detrás de 0.603 / 0.114 de Jev. En ese segmento, la calibración reduce la brecha sin cerrarla.
Dónde encaja un router y dónde aún no
El obstáculo práctico para usar este modelo no es la precisión, sino el empaquetado. La versión se distribuye como una clase de Python que se importa tras descargar cuatro fragmentos, no como un endpoint HTTP al que puedas llamar. Ese es precisamente el vacío que una capa de enrutamiento existe para cerrar —una sola clave para más de 200 modelos, el precio de lista del proveedor traspasado con un 0 % de margen, y conmutación automática por error cuando un proveedor falla — pero conviene ser francos: OrcaRouter no incluye actualmente Intern-Decision-4B ni ningún modelo de su tipo. Nuestro catálogo no lo lista, y nada de lo que aquí se dice debe interpretarse como una afirmación de disponibilidad. Lo que sí podemos ofrecer es la decisión más económica: si quieres probar un evaluador de decisiones de 4,5 mil millones de parámetros delante de una ruta de producción, puedes integrarlo en un router con un respaldo a un modelo general, de modo que un día de mala calibración te cueste un reintento en lugar de una caída del servicio.
¿Qué cambiaría el panorama?
Tres cosas, por orden de importancia. Alguien de fuera de InternLM tiene que reproducir el 90.02 y el error de calibración esperado de 0.065: las afirmaciones de calibración que no se han enfrentado a un conjunto de pruebas externo son los números menos transferibles del aprendizaje automático. La propia tarjeta tiene que aparecer: el Space, la colección, el repositorio de GitHub. Y el proveedor tiene que decir si esto es un producto o un artefacto de paper, porque una licencia solo para investigación y una licencia Apache-2.0 no son el mismo compromiso, y el 4B eligió Apache-2.0 con la licencia Qwen conservada junto a ella. Hasta entonces, el encuadre correcto es el que la propia subida sugiere: este es un checkpoint real con un contrato de inferencia real y un scorecard completamente sin verificar, publicado sin que nadie fuera informado.
Por ahora, el resumen honesto es acotado y útil. Si tu problema es «elige una de cinco etiquetas de enrutamiento y dime qué tan seguro estás», un modelo de 4,5B que emite 62 logits y nada de prosa es una forma defendible de evaluar. Si tu problema implica un documento largo, más de ocho imágenes o cualquier necesidad de explicar la respuesta con palabras, este checkpoint tal como se entrega es la herramienta equivocada, y ningún grado de pulido en los benchmarks del proveedor cambia eso.
