
Intern-Decision-0.8B llegó sin anuncio: lo que InternLM puso silenciosamente en Hugging Face
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 592 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
El enlace de GitHub en la tarjeta del modelo devuelve 404. El Space de demostración devuelve 401. No hay ninguna colección, ninguna entrada de blog, ningún informe técnico y ningún resultado de búsqueda en ninguna parte para la cadena "Intern-Decision" que no sea una oferta de prácticas — y sin embargo Intern-Decision-0.8B está en Hugging Face ahora mismo como un checkpoint completo y descargable bajo Apache-2.0, ajustado a partir de Qwen3.5-0.8B, subido en la madrugada del 26 de septiembre de 2026 junto con dos hermanos mayores que aparecieron en los mismos tres minutos: Intern-Decision-2B e Intern-Decision-4B. InternLM ha lanzado de esta manera antes, y es por eso que todo lo que sigue se ha reunido a partir del propio repositorio en lugar de un artículo de lanzamiento. La distinción importa aquí más que de costumbre: un repositorio te dice qué existe, y solo el proveedor puede decirte para qué sirve.
Lo que el repositorio sí dice, en detalle, es lo bastante inusual como para merecer la lectura. Estos no son modelos de chat ni modelos de lenguaje pequeños en el sentido habitual. Intern-Decision-0.8B toma un fragmento de estado, un esquema de preguntas con nombre que escribes de antemano y, opcionalmente, hasta ocho imágenes, y devuelve una distribución de respuestas para cada pregunta en una sola pasada hacia adelante. Nunca llama a generate(). Nunca muestrea. No hay salida de texto que parsear, ni JSON que reparar, ni bucle de reintentos en torno a una llave que nunca se cerró. La estrechez es toda la arquitectura, y sitúa a este modelo en la misma pequeña categoría que Jev 1.13 de TypeSafe y Laya de Convai — una categoría contra la que InternLM, evidentemente, comparó a propósito, porque Jevbench es el propio benchmark de TypeSafe y es la primera columna de la tabla.
Esto es lo que se puede saber a partir del checkpoint, lo que solo afirma el checkpoint y lo que nadie fuera de InternLM puede decir actualmente en absoluto.
¿Qué hay realmente en el repositorio?
La tarjeta es breve y sincera en cuanto al linaje. Intern-Decision-0.8B se describe como «un modelo de decisión estructurado multimodal ajustado a partir de Qwen3.5-0.8B» —la base Qwen publicada el 28 de febrero de 2026—, y el repositorio incluye un segundo archivo de licencia, LICENSE-QWEN, junto con los términos de Apache-2.0, lo cual es lo que se supone que debe hacer un modelo derivado y es, por derecho propio, una pequeña señal de honestidad. El índice de Hugging Face reporta 852.985.920 parámetros en tres fragmentos: un fragmento de lenguaje de 1,50 GB, un fragmento de visión de 176 MB y un proyector de 25 MB. El almacenamiento total del repositorio es de aproximadamente 1,73 GB, incluidos los archivos del tokenizador, lo que hace que todo quepa cómodamente en una sola GPU de consumo o en un portátil bien equipado.
La configuración revela una arquitectura que Qwen ha estado distribuyendo a lo largo de la generación 3.5, en lugar de una red de decisión a medida. Es un Qwen3_5ForConditionalGeneration con 24 capas dispuestas en un patrón repetitivo de tres capas de atención lineal por cada capa de atención completa, tamaño oculto de 1.024, 8 cabezas de atención frente a 2 cabezas de clave-valor, una dimensión de cabeza de 256 y un embedding de posición máximo de 262.144 tokens. Se conserva una única capa de predicción multi-token. La ruta de visión es real: el texto de la tarjeta describe el manejo de imágenes, el procesador acepta imágenes y el checkpoint incluye una torre de visión y un proyector para servirla, así que la etiqueta multimodal del repositorio está respaldada por pesos, no solo por etiquetas.
Vale la pena fijarse en el panorama de la familia, porque condiciona cómo leer todo lo demás. InternLM subió tres tamaños en 40 segundos: 0.8B, luego 2B y después 4B. Los recuentos de parámetros son 852.985.920, 2.213.241.664 y 4.539.265.536. La tarjeta del modelo 4B incluye una sección adicional —un piloto de calibración de distribución conocida de 96 casos con puntuaciones antes y después— que la tarjeta del 0.8B no tiene. Esa asimetría no es evidencia de un defecto en el modelo pequeño; es evidencia de que la documentación del modelo pequeño se escribió con un presupuesto más corto, que es el tipo de cosa que caracteriza a un lanzamiento discreto.
Cómo funciona realmente la ruta de inferencia
El archivo inference.py incluido es el archivo más informativo del repositorio, porque documenta un contrato en lugar de un prompt. La secuencia funciona así:
• Tú proporcionas una solicitud con state (el objeto que se evalúa), questions (un esquema) y, opcionalmente, imágenes.
• Las opciones de cada pregunta se asignan a símbolos de un solo token — de la A a la Z, luego minúsculas, luego dígitos, hasta 62 opciones por pregunta.
• El prompt del sistema, el estado, el esquema y un esqueleto JSON completo del asistente se renderizan con un marcador de posición <decision> por campo.
• Se ejecuta una pasada hacia adelante causal. Los logits se leen en la posición inmediatamente anterior a cada marcador de posición.
• Se aplica un softmax solo sobre los símbolos candidatos permitidos de ese campo, se aplica la calibración del checkpoint y los símbolos se asignan de nuevo a los valores originales de tus opciones.
El motor expone tres tipos de preguntas. choice toma un objeto ordenado que asigna valores de opción a descripciones. score toma una lista —que se convierte en los valores de cadena "0", "1", "2", etc.— o un objeto ordenado con claves de cadena numéricas finitas, lo que permite que el modelo devuelva un valor esperado ponderado por probabilidad y no solo una categoría. noul es una decisión binaria con «no» antes de «sí». La respuesta devuelve, por campo, la distribución de probabilidad calibrada, una confianza igual a la probabilidad máxima de los candidatos, la decisión argmax con desempate léxico y, para las preguntas de tipo score, el valor numérico esperado y una leyenda. Los límites son explícitos: de una a dieciséis preguntas por solicitud, hasta 62 opciones cada una, un límite de entrada predeterminado de 8.192 tokens que se rechaza en lugar de truncarse, y un máximo de ocho imágenes cuyos tokens cuentan para ese límite.
Dos detalles de esa lista merecen atención porque determinan si puedes confiar en el resultado. El primero es que no se insertan respuestas de referencia en el prompt: el modelo puntúa candidatos para los que no se le ha mostrado la respuesta. El segundo es que usage.output_tokens no es un recuento de tokens de texto; cuenta campos puntuados. Cualquiera que integre esto en un cálculo existente de presupuesto de tokens se llevará una sorpresa por ello, y la ficha lo dice en lugar de dejarlo para que se descubra.

La tabla de benchmarks, y cuánto de ella creer
Advertencia para el lector sobre esta sección: cada número a continuación está reportado por el proveedor y no ha sido reproducido. InternLM seleccionó los benchmarks, seleccionó los modelos de comparación, ejecutó las evaluaciones y publicó la tabla. No existe ninguna ejecución independiente de Intern-Decision-0.8B en ninguna tabla de clasificación pública, y una búsqueda en Artificial Analysis no devuelve nada para el modelo en absoluto. Eso no hace que la tabla sea falsa. La convierte en no auditada, y significa que las columnas son más útiles para leer la forma del resultado que su nivel.

• Jevbench, tres splits: Intern-Decision-0.8B obtiene 97.92 en Easy, 80.56 en Original y 52.25 en Hard. El Jev de TypeSafe se sitúa en 100.00, 98.61 y 72.07 en los mismos splits.
• Decisión tipada — el 0.8B puntúa 77.35 frente a los 73.35 de Jev. Esta es la única columna en la que el modelo más pequeño del campo supera al modelo que da nombre al benchmark.
• ToolACE — 94,52 para el 0.8B frente a 91,29 para Jev. ToolACE es un benchmark de llamada a funciones, y una cabeza de decisión que supera a Jev en selección de herramientas es la afirmación más sustantiva de la tabla.
• AG News — 88.61 frente a los 89.57 de Jev. Efectivamente, a la par de la vanguardia de esta categoría en clasificación de temas de cuatro clases.
• WildJailBreak — 64,48 frente a los 96,29 de Jev. Este es el colapso. Podría decirse que es la columna que más importa para un modelo al que expondrías a entradas no confiables, y aquella en la que el 0,8B está más lejos de la referencia.
• Promedio — 79,38 para el de 0,8B, 84,68 para su propio hermano de 2B, 90,02 para el de 4B. La familia asciende de forma pronunciada, lo cual es exactamente lo que cabría esperar y constituye en sí mismo un argumento moderado de que no se le hizo ingeniería inversa a la tabla para adular al buque insignia.
• Calibración — Brier 0.530 y error de calibración esperado 0.066 para el 0.8B. Jev reporta 0.358 y 0.095. Leídos juntos, esos dos datos ofrecen una imagen más clara que la que da cualquiera de los dos por separado: el 0.8B está mejor calibrado que Jev en el sentido del ECE —sus confianzas declaradas se ajustan más a su exactitud—, aunque es considerablemente menos preciso en general. Ese es un perfil plausible para un modelo pequeño con una temperatura ajustada deliberadamente, y no es una combinación halagadora para publicar por accidente.
El conjunto de comparación tiene una propiedad llamativa: está dominado por modelos de decisión. Aparecen Jev, Laya, SemIf, Kev y JevK5; el propio benchmark de la tabla es de TypeSafe. InternLM eligió medirse en el terreno de un competidor, usando el arnés de un competidor, y luego publicó las columnas donde su modelo más pequeño pierde. Es el tipo de decisión que toma un equipo cuando no planea una campaña de marketing en torno al lanzamiento, lo cual es coherente con todo lo demás sobre cómo se lanzó esto.
La temperatura de calibración es el número más interesante
Intern-Decision-0.8B ajusta una temperatura predeterminada de 2.747760550703, mediante la minimización de NLL sobre 1.728 casos de calibración designados con 1.693 casos de validación separados. La tarjeta deja claro que no se usaron las etiquetas del conjunto de pruebas para seleccionarla. La transformación aplicada es p = softmax(candidate_logits.float()), seguida de calibrated_p = softmax(log(p) / T).
Eso es calibración de probabilidades de candidatos, no una temperatura de muestreo, y la distinción no es pedantería. Como la transformación se aplica después del softmax y preserva el orden, no puede cambiar en absoluto la decisión del argmax. Desplaza la confianza, la probabilidad de sí noul y el valor esperado de una pregunta de puntuación — y deja idéntica la decisión principal. Si tu flujo de trabajo lee la etiqueta, la temperatura no tiene efecto. Si tu flujo de trabajo lee la probabilidad —le aplica umbrales, ordena según ella o la introduce en un cálculo de valor esperado posterior—, la temperatura es la diferencia entre un número que significa algo y un número que no. Pasar temperature=1 devuelve la distribución sin calibrar, lo cual es una válvula de escape útil para cualquiera que quiera aplicar su propia calibración encima.
La temperatura se ajusta por checkpoint en lugar de compartirse. El modelo 4B usa un valor distinto, 1.99241824, y la tarjeta te indica que uses el módulo de inferencia que se distribuye con el tamaño que descargaste, para que su calibración predeterminada coincida. Cualquiera que copie un wrapper de inferencia de un hermano a otro aplicará silenciosamente la temperatura incorrecta.
Treinta y cuatro milisegundos, y un resultado que no debería ser posible
InternLM midió la latencia de extremo a extremo por consulta en una única RTX 4090 usando la ruta local de Hugging Face: una medición real, pero también la configuración de servicio más lenta posible, ya que una implementación en producción usaría un runtime compilado o con batching. Jev figura con 109,70 ms de media y 106,30 ms de mediana, con un p95 de 146,70 ms. Intern-Decision-0.8B se sitúa en 33,98 / 33,44 / 37,50 ms.
El número en el que vale la pena detenerse es el del modelo hermano 2B: 33.28 ms de media, 33.15 ms de mediana. El 2B es más rápido que el 0.8B, por un margen lo suficientemente pequeño como para ser ruido, pero no en la dirección que predicen los recuentos de parámetros. Eso no es un error en la tabla y no tiene realmente que ver con los modelos. Un modelo de decisión realiza exactamente una pasada hacia delante sobre un prompt cuya longitud viene determinada por el estado, el esquema y las descripciones de opciones — no por nada que escriba el modelo, porque no escribe nada. Para los prompts en ese régimen, el procesamiento del prompt domina y el recuento de parámetros es un coste de segundo orden. La consecuencia práctica es que la razón habitual para recurrir al checkpoint más pequeño —pagas por token— no se aplica aquí. La verdadera razón para elegir el 0.8B en lugar del 2B es el consumo de memoria y el hecho de que todo su repositorio cabe en 1.73 GB, no el rendimiento.
Lo que aún no se puede establecer
Esta es la parte que habría respondido una publicación de lanzamiento y que un repositorio no puede.
No se ha indicado una fecha de lanzamiento, no hay ningún anuncio y no hay nada en los canales públicos de InternLM que describa la familia. La URL de GitHub impresa en la tarjeta del modelo no se resuelve. El Space de demostración al que se hace referencia en la tarjeta no es de lectura pública. No hay una colección que reúna los tres checkpoints, lo que significa que la única forma de encontrar el 2B o el 4B es mirar la lista de modelos de la organización. No hay artículo, por lo que los datos de entrenamiento, la receta de ajuste, el número de pasos de entrenamiento y qué modificó el «decision tuning» en los pesos no se indican. No hay evaluación independiente, ni replicación de latencia por terceros, ni evidencia de que alguien fuera de InternLM haya ejecutado el checkpoint.
También hay dos preguntas que la tarjeta plantea sin responder. La primera es qué significa en la práctica la brecha de WildJailBreak: un déficit de robustez de rechazo de ese tamaño es una propiedad del ajuste fino, y si refleja el modelo base, el objetivo de ajuste de decisión o el pequeño número de parámetros no es algo que te diga el repositorio. La segunda es qué ocurre en el techo de entrada. Las solicitudes que superan los 8,192 tokens se rechazan en lugar de truncarse, que es el comportamiento correcto para un modelo de puntuación, pero significa que la ventana de contexto práctica no son los 262,144 que anuncia la configuración, sino lo que quepa en 8,192 tokens de estado, esquema, opciones y parches de imagen. Para documentos largos con esquemas ricos, ese techo llega antes de lo que sugiere el diagrama de arquitectura.
Dónde se sitúa esto, y cómo probarlo sin apostar por ello
El planteamiento honesto es que Intern-Decision-0.8B es un checkpoint publicado con afirmaciones no auditadas y sin documentación que las respalde. Esa combinación no es motivo para ignorarlo —una publicación de pesos con licencia Apache-2.0 que puedes descargar y medir en una tarde es una situación mejor que una API con lista de espera—, pero sí significa que la carga de la validación recae sobre ti. El motor carga desde un directorio local, se ejecuta en una GPU de clase 4090 o inferior, y la tarjeta proporciona una solicitud de ejemplo que puedes pegar. Un día de evaluación con tus propios casos etiquetados te dirá más sobre la columna WildJailBreak de lo que puede decirte la tabla del proveedor.
Si la capa de decisión es la parte que estás evaluando, el objetivo de comparación útil es uno alojado. El Jev 1.13 de TypeSafe es el modelo con el que InternLM hizo el benchmark, y hoy se puede invocar a través de un único endpoint compatible con OpenAI a $0.042 por millón de tokens de entrada, con la salida facturada a cero — el mismo precio que publica el proveedor, porque OrcaRouter traslada el precio de lista del proveedor sin ningún margen en lugar de añadir un margen encima. Poner una cabeza de decisión autoalojada de 0.8B y una API de decisión alojada en la misma clave, en la misma tarde, es un experimento considerablemente más barato que montar dos contratos separados para responder a la misma pregunta.

Lo que cambiaría esta imagen no es un benchmark. Es que aparezca el repositorio de GitHub, o que InternLM publique la receta de ajuste, o que una primera ejecución independiente del checkpoint llegue a una tabla de clasificación. Hasta que ocurra una de esas cosas, la descripción precisa de Intern-Decision-0.8B es limitada y poco halagüeña, y totalmente a su favor: los pesos son reales, el contrato de inferencia está documentado mejor de lo que consiguen la mayoría de los modelos lanzados, y el marketing aún no ha empezado.
