Una tarjeta de título para un artículo comparativo que dice Intern-Decision-0.8B vs Qwen 3.8, subtitulada 853 millones de parámetros, 1.71 GB y un conjunto cerrado de respuestas, con tres tarjetas de línea planas que dicen Sujeto: Intern-Decision-0.8B lanzado el 26 de septiembre de 2026 sin anuncio, Oponente: Qwen 3.8, un núcleo disperso de 2.4T con Qwen3.8-Max a $2.00 y $6.00, y Hallazgo clave: el hermano de 2B es más rápido y más preciso, mientras que solo la huella favorece al 0.8B.
Engineering & Research

Intern-Decision-0.8B vs Qwen 3.8: 853 millones de parámetros y un conjunto cerrado de respuestas

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Intern-Decision-0.8B es el más pequeño de los tres modelos de decisión que InternLM subió a Hugging Face en la mañana del 26 de septiembre de 2026, y no es el más rápido de ellos. Eso es lo primero que vale la pena saber. Según las propias mediciones del laboratorio, el hermano de 2B se ejecuta marginalmente más rápido —33,28 ms frente a 33,98 ms— y obtiene seis puntos más en el mismo promedio de siete suites, así que la razón habitual para recurrir a un checkpoint de menos de mil millones, la velocidad bruta, no se aplica aquí. Lo que se aplica es el tamaño: 852.985.920 parámetros, 1,71 GB de pesos bf16, lo suficientemente pequeño como para residir permanentemente en el margen de una máquina que tiene algo más que hacer. Compare eso con Qwen3.8-Max —la entrega alojada del núcleo de mezcla dispersa de expertos de 2,4 billones de parámetros que el proveedor publicó en agosto, con un precio de $2,00 y $6,00 por millón de tokens— y los dos no compiten por el mismo trabajo. Uno devuelve una distribución de probabilidad sobre las opciones que proporcionaste de antemano. El otro escribe.

La respuesta corta: vale la pena tener Intern-Decision-0.8B si necesitas una decisión de conjunto cerrado evaluada en hardware que ya posees, y si 1,71 GB en lugar de 4,43 GB es la diferencia entre lanzar y no lanzar. No vale la pena tenerlo si quieres el evaluador pequeño más preciso que InternLM lanzó esta semana —ese es el 4B—, o si tu respuesta no está ya enumerada en tu prompt, en cuyo caso ninguno de estos dos es la herramienta adecuada y Qwen 3 es el único del par que puede hacer el trabajo siquiera.

Lo que dice el repositorio, y lo que ninguna otra cosa dice.

Empecemos por la evidencia, porque hay muy poca. InternLM no ha hecho ningún anuncio sobre este modelo. Ni publicación de lanzamiento, ni artículo, ni descripción del repositorio. La tarjeta de Hugging Face enlaza un Space de demostración y un repositorio de GitHub, y a la fecha de este escrito el Space devuelve 401 y el enlace de GitHub devuelve 404 — los dos lugares a los que la tarjeta te remite para obtener más información están cerrados. Tres checkpoints aparecieron con cuarenta segundos de diferencia entre sí, aproximadamente a las 05:36 UTC del 26 de septiembre: Intern-Decision-0.8B, Intern-Decision-2B e Intern-Decision-4B, todos con las mismas etiquetas — toma de decisiones, multimodal, predicción estructurada — y todos son ajustes finos de checkpoints de Qwen, en este caso Qwen3.5-0.8B.

Lo que se puede saber del repositorio es inusualmente preciso para un lanzamiento no anunciado, porque el laboratorio distribuyó su propio módulo de inferencia junto con los pesos. El 0.8B se carga mediante un 16 KB inference.py en el directorio del modelo, requiere Python 3.12 o posterior y torch 2.9.1 con transformers 5.14.1, y expone una DecisionEngine clase que se instancia una vez y se reutiliza. Un dict de Python de entrada, un dict de respuesta de salida. Lo que no se puede saber: si se trata de un lanzamiento terminado o de un adelanto temprano, si habrá un endpoint alojado, y si los dos checkpoints entre los que se sitúa están pensados para ser el mismo producto en distintos tamaños o tres productos distintos que casualmente comparten nombre. Nadie fuera de InternLM ha ejecutado ninguno de ellos.

The Hugging Face model card for InternLM's Intern-Decision-0.8B, showing the internlm organisation, a 0.9B params label, tags for image-text-to-text, transformers, safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational, an opening line stating the model is a multimodal structured decision model fine-tuned from Qwen3.5-0.8B, and a Checkpoint and docs section that also reports 0.9B params.

El problema del hermano: el 2B es más rápido y mejor

Esta es la parte de la tabla publicada por el propio InternLM que hace que el 0.8B sea difícil de situar. Leyendo los tres tamaños en las mismas siete suites:

• Velocidad — 0.8B: 33,98 ms de media, 33,44 ms de mediana, 37,50 ms en p95. 2B: 33,28 ms, 33,15 ms, 33,55 ms. 4B: 44,16 ms, 44,03 ms, 44,60 ms. Todas medidas por consulta en una única RTX 4090 a través de la ruta local de Hugging Face.

• Promedio de siete suites — 0,8B: 79,38. 2B: 84,68. 4B: 90,02.

• Calibración — 0,8B: Brier 0,530, ECE 0,066. 2B: Brier 0,437, ECE 0,100. 4B: Brier 0,347, ECE 0,065.

• Huella en disco en bf16 — 0.8B: 1.71 GB. 2B: 4.43 GB. 4B: 9.08 GB.

El 2B es más rápido en la media, drásticamente más ajustado en la cola y más preciso, todo a la vez. Así que «más pequeño significa más rápido» es falso en toda esta familia —por partida doble, ya que el 4B es más lento que ambos. El único eje en el que el 0.8B gana sin discusión es el que nadie evalúa con benchmarks: 1,71 GB frente a los 4,43 GB del 2B y los 9,08 GB del 4B. Si vas a colocar un puntuador en un presupuesto de memoria fijo —una máquina pequeña siempre encendida, una GPU compartida con otros, un nodo de borde con un modelo de lenguaje que ya ocupa la mayor parte de la tarjeta—, ese es todo el argumento, y es un argumento real.

El resto de la tabla es un estudio sobre dónde fallan los modelos pequeños de forma desigual. La puntuación de Typed Decision del 0.8B es 77.35 frente al 80.55 del 4B —tres puntos de diferencia con una quinta parte del número de parámetros—. Pero Jevbench-Original cae de 98.61 a 80.56 y WildJailBreak se desploma de 89.86 a 64.48. Sea lo que sea que midan esas dos suites —la ficha no lo dice, y la ficha no da ninguna definición de las suites en absoluto—, son las que castigan con más dureza al checkpoint pequeño. Un modelo que se sostiene en un eje y se despeña en otros dos no es un modelo uniformemente más débil. Es un modelo con una frontera de competencia específica, y querrías saber dónde se sitúa tu carga de trabajo antes de comprometer la flota con él.

Una advertencia más sobre la fila de calibración. El ECE de 0.066 del 0.8B es su mejor cifra —mejor que el 0.095 de Jev en la misma suite—, mientras que su puntuación de Brier de 0.530 es peor que la 0.358 de Jev. El error calibrado y el error cuadrático medio de probabilidad no son la misma medición, y una tabla que muestra uno con aspecto sólido y el otro con aspecto débil te está diciendo que la distribución tiene buena forma cerca de sus picos de confianza y es más gruesa de lo que debería en el medio. Si tu sistema establece umbrales según la confianza, esa distinción importa más que el promedio.

Lo que 1.71 realmente compra

La ruta de inferencia en este modelo es un evaluador, no un generador, y la diferencia de costo es estructural, no incremental. Le proporcionas un estado compartido, un esquema de preguntas con nombre y, opcionalmente, hasta ocho imágenes. Cada pregunta es de uno de tres tipos: opción (una de un conjunto ordenado de opciones), puntuación (una escala ordinal, devuelta como un valor esperado ponderado por probabilidad), o noul (binario no/sí). El estado, el esquema y un esqueleto JSON de asistente completo se representan con un marcador de posición por campo, el modelo ejecuta una única pasada hacia adelante causal, y los logits se leen en la posición inmediatamente anterior a cada marcador de posición. Se toma un softmax solo sobre los símbolos candidatos permitidos de ese campo, se aplica la calibración ajustada del checkpoint, los símbolos se asignan de vuelta a los valores de tus opciones.

De eso se derivan tres consecuencias. No hay token de salida y, por lo tanto, no hay precio de salida: un millón de decisiones no cuestan nada en tokens. No hay bucle de decodificación ni una llave que olvidar, así que el JSON malformado no es un modo de fallo. Y como el espacio de respuestas de cada campo se ensambla por solicitud, un esquema que inventes esta tarde no necesita reentrenamiento: agrega una pregunta y sus opciones se convierten en símbolos candidatos para ese campo.

Los límites se indican con la misma claridad. De una a dieciséis preguntas, hasta 62 opciones cada una, hasta ocho imágenes y un límite predeterminado de 8,192 tokens — y las entradas que lo superan se rechazan en lugar de truncarse. Esa última cláusula es una decisión de diseño sobre la que vale la pena detenerse, porque el truncamiento silencioso es la forma en que un clasificador empieza a responder en silencio una pregunta distinta de la que hiciste. InternLM, en cambio, falla de forma ruidosa, lo cual es correcto y también una trampa operativa: un hilo de tickets largo más un esquema más imágenes superarán las 8,192 antes de lo que esperas, y no hay una vía elegante cuando eso ocurre.

Y los 1,71 GB compran una economía de tiempo de ejecución que puedes calcular multiplicando. A 33,98 ms por decisión, un millón de decisiones son 9,44 horas de una RTX 4090. El 4B necesita 12,3 horas para el mismo millón, y renuncia a diez puntos y medio de precisión a cambio de los 7,37 GB que no tenías. Ninguno de los dos números incluye el costo de la máquina, y ninguno incluye la parte que la gente olvida: estás operando un servicio, y no hay ningún servidor en el repositorio.

The OrcaRouter model page for Qwen3.8 Max, showing the model name, family and tier badges, a 1,000,000-token context window, pricing of $2.00 per million input tokens and $6.00 per million output tokens, an output speed of 63.71 tokens per second, an error rate of 0.69 percent, an Artificial Analysis index of 45.4 at rank 15 of 145, and a side panel listing Qwen 3.8 27B at an Artificial Analysis intelligence index of 33.65 with $0.33 and $2.40 per million tokens.

Qwen 3.8 no es un solo modelo, y el extremo barato es el que hay que tener en cuenta

Qwen 3.8, tomado como nombre independiente, es Qwen3.8-2.4T-A95B: el núcleo disperso de mezcla de expertos de 2,4 billones de parámetros que Alibaba publicó como pesos abiertos el 12 de agosto de 2026, con aproximadamente 95.000 millones de parámetros activos por token y una licencia personalizada en lugar de Apache 2.0. La entrega alojada de ese mismo núcleo es Qwen3.8-Max, disponible de forma general en una API de pago desde el 3 de agosto y actualizada como una instantánea fechada del 2 de septiembre. Son un solo cerebro vendido de dos maneras, y la segunda entrega es la que la mayoría de la gente realmente usará.

Según cifras independientes, Artificial Analysis mide la instantánea de septiembre de Qwen3.8-Max con un Índice de Inteligencia de 45,4 —decimoquinto de 145 modelos indexados—, con una puntuación de Codificación AA de 76,2 en noveno lugar de 138, GPQA Diamond en 92,8, Humanity's Last Exam en 43,1 y una puntuación de recuperación de contexto largo de 80,3. El checkpoint abierto queda por detrás de la API de la que se destiló, con 39,9. En nuestra propia ventana de playground de siete días, Qwen3.8-Max se sitúa en una p50 de 2.578 ms y una p95 de 9.539 ms con 55,5 tokens de salida por segundo, con una tasa de error del 1,57 %. Qwen3.8-Max se puede invocar en OrcaRouter a precio de lista del proveedor con un 0 % de recargo añadido, de modo que un cambio de precios de Alibaba se aplica en nuestro lado el mismo día, y no en el siguiente ciclo de facturación.

No obstante, el hermano denso es el que hay que sopesar frente a un checkpoint local de 1,71 GB, porque es la forma más barata de comprar capacidad general en esta familia. Qwen3.8-27B tiene licencia Apache 2.0, cuenta con un contexto nativo de 262.144 tokens, y Qwen3.8-27B se sitúa en $0,33 y $2,40 por millón de tokens en nuestro catálogo. Su Artificial Analysis Intelligence Index es 33,7. Tiene aproximadamente treinta y dos veces el número de parámetros de Intern-Decision-0.8B, sigue siendo generativo y sigue siendo el instrumento equivocado para una decisión de conjunto cerrado a gran escala — pero es la opción intermedia honesta, y el único miembro de esta comparación que es realmente barato y realmente general al mismo tiempo.

Puntuador frente a generador, dicho sin rodeos.

• Contexto — Qwen3.8-Max tiene una ventana de 1.000.000 de tokens. Intern-Decision-0.8B rechaza todo lo que supere los 8.192. Un factor de 122, aplicado en lugar de truncado.

• Entrada — Qwen3.8-Max acepta texto, imagen y vídeo. Intern-Decision-0.8B acepta texto y hasta ocho imágenes, y los tokens de imagen cuentan dentro del mismo presupuesto de 8.192.

• Salida — Qwen3.8-Max escribe, razona, invoca herramientas y emite JSON cuando se le solicita. Intern-Decision-0.8B no puede producir un párrafo, una justificación ni un plan. Solo puede puntuar las opciones que ya se te ocurrió enumerar.

• Coste por llamada — una llamada de triaje realista de 800 tokens de entrada y 150 tokens de salida cuesta alrededor de 0,0025 $ en Qwen3.8-Max, antes de contar ningún token de razonamiento, y su lado de salida es optimistamente pequeño porque es un modelo de razonamiento. Un millón de llamadas de este tipo cuesta aproximadamente 2500 $. Intern-Decision-0.8B no tiene ningún precio por token: un millón de decisiones son 9,44 horas de una 4090 que poseas o alquiles.

• Latencia: 2,578 ms en la mediana en Qwen3.8-Max durante los últimos siete días, incluyendo la red y la cola. Los 33.98 ms de Intern-Decision-0.8B son una simple pasada forward en una tarjeta local y no es la misma medición; la comparación honesta es un orden de magnitud, no ochenta veces.

• {{1}}Evidencia{{/1}} — todas las cifras de {{2}}Intern-Dec-0.8B{{/2}} están reportadas por el proveedor en los propios harnesses de {{3}}InternLM{{/3}} y no han sido reproducidas por {{4}}nadie{{/4}}, incluida la latencia. Todas las cifras de {{5}}Qwen 3.8{{/5}} son de {{6}}Alibaba{{/6}} o de una medición de {{7}}Artificial Analysis{{/7}}, y se etiquetan por separado arriba.

• Puntuación independiente — Qwen3.8-Max tiene una. Intern-Decision-0.8B no tiene ninguna de ningún tipo, y ningún proveedor de inferencia lo despliega.

A two-column scoreboard comparing Intern-Decision-0.8B and Qwen 3.8. The Intern-Decision-0.8B column reads Parameters 853M, Seven-suite average 79.38, Context 8,192 tokens, Output scores only no text, Cost no token price 1.71 GB local, Latency 33.98 ms local pass. The Qwen 3.8 Max column reads Parameters 2.4T sparse, AA Intelligence Index 45.4, Context 1,000,000 tokens, Output text image video tools, Cost $2.00 and $6.00 per million, Latency 2,578 ms p50 hosted. A footer reads Intern-Decision-0.8B figures are vendor-reported and unreproduced; Qwen3.8-Max figures per Artificial Analysis and our own seven-day window.

Dos formas de ejecutar este pipeline

La bifurcación operativa es más marcada que la bifurcación del benchmark. Intern-Decision-0.8B es un módulo, no un servicio. No hay endpoint compatible con OpenAI, ni servidor de procesamiento por lotes, ni comprobación de estado, ni política de reintentos, ni una segunda réplica a menos que la construyas. Se carga en un solo proceso y responde a un dict a la vez, y si necesitas failover, tú eres el failover. Esa es una descripción justa de un checkpoint de investigación de 853 millones de parámetros publicado sin una nota de lanzamiento, y debería tenerse en cuenta en la decisión en consecuencia.

La mitad generativa del mismo pipeline es una llamada de red, y una llamada de red es justo para lo que sirve un enrutador. Tanto Qwen3.8-Max como Qwen3.8-27B son accesibles detrás de una única clave compatible con OpenAI, y la conmutación por error automática hace que un upstream degradado no se convierta en tu incidente — vale la pena señalarlo aquí porque la tasa de error en vivo de siete días de Qwen3.8-Max de nuestro lado es del 1,57 %, que es baja hasta que se trata de tu solicitud. El patrón que tiene sentido es el que esta combinación ha estado describiendo en silencio: ejecutar localmente el scorer barato de conjunto cerrado porque es rápido y no cuesta nada por llamada, y enrutar el paso de razonamiento porque ahí es donde realmente ocurren los recortes de precios, la rotación de modelos y las caídas.

Dos cosas que no vamos a afirmar. Intern-Decision-0.8B no es una de nuestras rutas y no lo será hasta que InternLM lo aloje en algún lugar — no vamos a insinuar lo contrario. Y hoy no alojamos ningún modelo de InternLM en absoluto, así que nada en este artículo es una propuesta para ejecutar el modelo en cuestión a través de nosotros.

¿Qué cambiaría la respuesta?

Tres preguntas abiertas, todas con respuesta en cuestión de días. ¿Publica InternLM el repositorio de GitHub al que enlaza su propia tarjeta, y con él una descripción de cómo se ajustaron estos pesos? ¿A los checkpoints les sigue una publicación de lanzamiento, que convierta un push silencioso en un lanzamiento documentado con una historia de despliegue declarada? ¿Y reproduce alguien independiente el promedio de 79.38 o el error de calibración de 0.066 en hardware que no sea de InternLM?

Hasta que llegue uno de esos, la lectura honesta de Intern-Decision-0.8B es acotada y específica: es el puntuador de conjunto cerrado más barato de una familia de tres, con una huella que encaja donde su propio hermano, más rápido y más preciso, no lo hace, publicado sin un anuncio y sin el único artefacto que te diría para qué fue ajustado. Si tu decisión es de conjunto cerrado, tus respuestas son enumerables en un prompt y 1.71 GB es el número del que realmente depende tu despliegue, entonces es la elección correcta y no hay nada igual en ese tamaño. Si tu respuesta no es enumerable de antemano, o tu estado supera los 8,192 tokens, o necesitas una justificación que puedas mostrarle a un ser humano, entonces la comparación nunca estuvo reñida —y el modelo que quieres nunca fue el de 853 millones de parámetros.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario