Una tarjeta de título para un artículo comparativo que dice Intern-Decision-4B vs Qwen 3.8, con el subtítulo Un paso hacia adelante de 44 milisegundos frente a 2,4 billones de parámetros, con tres iconos de línea plana que sugieren un puntuador pequeño y rápido, un gran modelo de razonamiento y una comparación de costos.
Engineering & Research

Intern-Decision-4B vs Qwen 3.8: un pase hacia adelante de 44 milisegundos frente a 2,4 billones de parámetros

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

InternLM publicó Intern-Decision-4B en Hugging Face en la mañana del 26 de septiembre de 2026 — sin publicación de lanzamiento, sin entrada de blog, un enlace de GitHub en su propia tarjeta de modelo que devuelve 404 y un Space de demostración que devuelve 401. Los pesos son reales y descargables; el anuncio no está ahí. Y el modelo que hay debajo de ellos es un ajuste fino de Qwen3.5-4B, que es lo que hace que la comparación con el modelo insignia alojado valga más que una hoja de especificaciones. Estos dos no son rivales. Son los dos extremos de un mismo pipeline, y toda la cuestión es dónde cae la línea entre ellos. El núcleo subyacente es el modelo de 2,4 billones de parámetros que el proveedor publicó en agosto y ahora se sirve como Qwen3.8-Max, facturado a $2,00 y $6,00 por millón de tokens; Intern-Decision-4B es una reconstrucción de 4,54 mil millones de parámetros de ese modelo base de siete meses, que no emite ningún token en absoluto, responde hasta dieciséis preguntas tipadas en una sola pasada hacia adelante, y no cuesta nada por llamada porque no hay salida que facturar.

La respuesta en una línea: si tu tarea es una decisión con un conjunto cerrado de respuestas, Intern-Decision-4B es aproximadamente cincuenta veces más rápido por decisión y estructuralmente más barato, y ningún modelo de frontera lo superará en ese eje tan estrecho. Si tu tarea es cualquier otra cosa —razonamiento, contexto largo, uso de herramientas, cualquier cosa donde la respuesta no esté ya enumerada en tu prompt—, Qwen 3.8 no es simplemente mejor, es el único de los dos que puede hacer el trabajo en absoluto. Todo lo que sigue trata de encontrar esa línea con precisión.

Lo que está realmente confirmado, y lo que no

Empieza por la evidencia, porque el encuadre importa. No hay ningún anuncio del proveedor sobre Intern-Decision-4B. Ni nota de prensa, ni paper, ni descripción del repositorio que leer. Lo que existe hoy es un repositorio de Hugging Face publicado esta mañana bajo la organización internlm —Intern Large Models, el grupo del Shanghai AI Laboratory—, que lleva la licencia Apache 2.0 con la licencia upstream de Qwen conservada junto a ella como LICENSE-QWEN. Dos checkpoints hermanos aparecieron con cuarenta segundos de diferencia: Intern-Decision-0.8B con 853 millones de parámetros e Intern-Decision-2B con 2,21 mil millones. Los tres llevan las mismas etiquetas — toma de decisiones, multimodal, predicción estructurada — y los tres se encuentran bajo una colección de modelos que aún no se resuelve públicamente.

Lo que no está confirmado: si esta es la versión final o un lanzamiento anticipado. El repositorio se creó a las 05:36 UTC y se modificó de nuevo antes de las 08:00 UTC del mismo día, y la actividad pública adicional en los checkpoints hermanos continuó después de las 09:00. InternLM no ha dicho cuál es la estrategia de despliegue prevista, no ha publicado el repositorio al que enlaza y no ha dicho si habrá un endpoint alojado. Considera cada cifra de benchmark de este artículo como reportada por el proveedor y no reproducida, porque a la fecha de esta redacción literalmente no se ha escrito nada más sobre este modelo en ningún lugar. Tres rutas de búsqueda separadas no devuelven nada con ese nombre.

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

La apuesta arquitectónica: un puntuador, no un generador

La frase más importante en la propia documentación de Intern-Decision-4B es una negación: la ruta de inferencia "no llama a generate() ni muestrea texto de forma libre". Eso no es un detalle de implementación, es todo el diseño, y es lo que lo separa de llamar a Qwen3.8-Max con un esquema JSON y esperar a que se cierre la llave.

Este es el mecanismo, tal como lo describe la tarjeta. Se le entrega al modelo un estado compartido, un esquema de preguntas con nombre y, opcionalmente, hasta ocho imágenes. Cada pregunta es de uno de tres tipos: elección (elige una de un conjunto ordenado de opciones), puntuación (puntúa en una escala ordinal, devuelta como un valor esperado ponderado por probabilidad), o noul (un binario no/sí). El prompt del sistema, el estado, el esquema y un esqueleto JSON completo del asistente se renderizan con un marcador de posición por campo. Luego —y este es el truco— el modelo ejecuta una única pasada forward causal, y los logits se leen en la posición inmediatamente anterior a cada marcador de posición. Se aplica un softmax únicamente sobre los símbolos candidatos permitidos de ese campo, se aplica la calibración del checkpoint y los símbolos se asignan de vuelta a los valores de opción originales.

Las consecuencias son concretas. Dado que el espacio de respuestas de cada campo se ensambla por solicitud en lugar de estar integrado en una cabeza de vocabulario, un esquema que inventes esta tarde no necesita reentrenamiento: añade una pregunta y las opciones se convierten en símbolos candidatos para ese campo. Como no hay un bucle de decodificación, no hay token de salida, ni llave que olvidar, ni lógica de reintento en torno a JSON malformado. Y como todas las preguntas se puntúan a partir de la misma lectura del estado, dieciséis preguntas cuestan una sola pasada hacia adelante, no dieciséis.

Los límites son igual de concretos, y la ficha los enuncia sin ambages. De una a dieciséis preguntas, hasta 62 opciones por pregunta, hasta ocho imágenes. Un máximo predeterminado de 8.192 tokens — y las entradas que lo superan se rechazan sin truncamiento. Esa última cláusula es una decisión de diseño sobre la que vale la pena detenerse: el truncamiento silencioso es la forma en que un clasificador empieza, sin hacer ruido, a responder una pregunta distinta de la que le planteaste, y InternLM ha optado, en cambio, por fallar de forma ruidosa. Es la decisión correcta, y también es una trampa operativa, porque un hilo de tickets largo más un esquema más imágenes superarán los 8.192 antes de lo que esperas y no hay una salida elegante: obtienes un error.

Donde gana Intern-Decision-4B, y no es ni de cerca

Dos ejes, y ambos son estructurales y no incrementales.

• Latencia por decisión: 44,16 ms de media, 44,03 ms de mediana, 44,60 ms en el p95, medidos en una única RTX 4090 a través de la ruta local de Hugging Face. Frente a Qwen3.8-Max, cuya ventana activa de siete días en nuestro propio playground muestra una p50 de 2.474 ms y una p95 de 9.789 ms a 55,4 tokens de salida por segundo. Eso es aproximadamente 56× en la mediana, y la comparación no es tanto injusta como una comparación entre dos operaciones distintas: un modelo clasifica, el otro razona y luego escribe. La brecha es real y también lo es el motivo de ella.

• Coste por decisión — y este es aritmética, no opinión. Tomemos una llamada realista de triaje de soporte: 800 tokens de entrada de estado y esquema, y 150 tokens de salida de JSON estructurado. En Qwen3.8-Max eso es 800 × $2.00/M más 150 × $6.00/M, o alrededor de $0.0025 por decisión, antes de un solo token de razonamiento — y Qwen3.8-Max es un modelo de razonamiento, así que el lado de la salida es optimistamente pequeño. Un millón de decisiones cuesta aproximadamente $2,500. El mismo millón de decisiones en Intern-Decision-4B cuesta cero en tokens y aproximadamente 12.3 horas de tiempo de RTX 4090. Intern-Decision-4B no tiene precio de salida porque no tiene salida.

El intercambio es honesto y obvio: el 4B necesita una GPU que poseas o alquiles, ocupa esa GPU y solo puede hacer una cosa. Pero si esa única cosa es lo que tu producto hace millones de veces al día, la aritmética anterior constituye todo el caso de negocio, y ninguna cantidad de capacidad de modelos frontera lo cambia.

El número que Qwen 3.8 no publica: calibración

Este es el diferenciador silencioso, y es el que la mayoría de las comparativas pasará por alto porque no parece un benchmark.

Intern-Decision-4B devuelve una distribución sobre los valores de tus opciones, no solo una etiqueta — además de una confianza, y para nuevas preguntas, la probabilidad calibrada de sí. InternLM informa una puntuación de Brier de 0.347 y un error de calibración esperado de 0.065 en su propia suite, e incluye la temperatura ajustada en el checkpoint: 1.99241824, ajustada por separado para este tamaño mediante minimización de la log-verosimilitud negativa sobre 1,728 casos de calibración designados con 1,693 casos de validación reservados. Las etiquetas del conjunto de pruebas no se usaron para seleccionarla. Hay un segundo diagnóstico independiente de 96 casos en la ficha que usa distribuciones de referencia exactas en lugar de etiquetas muestreadas, y muestra que el Brier/ECE general pasa de 0.628 0.213 antes de la calibración a 0.550 / 0.089 después — el paso de calibración reduce el error esperado en bastante más de la mitad.

Ahora busca la misma cifra del lado de Qwen 3.8. No está ahí. Alibaba publica puntuaciones del Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking y recall de contexto largo —todas ellas medidas de capacidad. No publica ninguna métrica de calibración para ningún miembro de la familia Qwen 3.8, porque la confianza de un modelo generativo no es una cantidad que el proveedor incluya. Si tu sistema necesita una probabilidad con la que pueda establecer un umbral o enrutar, en lugar de una respuesta en la que deba confiar, esa diferencia no es una cuestión de grado. Un modelo te da un número con una tasa de error documentada; el otro te da texto, y tú construyes tu propia estimación de confianza en torno a él.

Donde Qwen 3.8 gana, y no es ni de cerca

Pon los dos uno al lado del otro respecto a lo que se les puede pedir que hagan y los límites dejan de ser sutiles.

• Contexto — Qwen3.8-Max tiene una ventana de 1.000.000 de tokens. Intern-Decision-4B rechaza cualquier cosa que supere los 8.192. Eso es un factor de 122, y no hay solución alternativa, porque el límite de entrada se aplica en lugar de truncarse.

• Modalidad de entrada — Qwen3.8-Max acepta texto, imagen y video. Intern-Decision-4B acepta texto e imágenes, hasta ocho, y los tokens de imagen cuentan contra el mismo presupuesto de 8,192.

• Razonamiento y herramientas — Qwen3.8-Max incluye el uso de herramientas, el modo JSON y el razonamiento entre sus capacidades declaradas, y registra un Índice de Inteligencia de Artificial Analysis de 45.4, decimoquinto de 145 modelos indexados, con una puntuación AA Coding de 76.2 en noveno lugar de 138. Esas son cifras independientes publicadas por Artificial Analysis, no afirmaciones de proveedores. Intern-Decision-4B no tiene entrada en Artificial Analysis, ni ninguna puntuación independiente de ningún tipo, ni capacidad para razonar, planificar o invocar nada.

• Salida abierta — Qwen3.8-Max escribe. Intern-Decision-4B no puede producir un párrafo, una justificación ni un plan. Solo puede puntuar las opciones que ya se te ocurrió enumerar.

También vale la pena señalarlo en el lado de los pesos abiertos: si quieres el propio núcleo de Qwen 3.8 y no la ruta alojada, Qwen3.8-27B es el hermano denso — 27,8 mil millones de parámetros, Apache 2.0, un contexto de 262.144 tokens y aproximadamente $0,33 / $2,40 por millón de tokens donde se sirve. Obtiene 33,7 en el AA Intelligence Index. Sigue siendo un orden de magnitud más grande que Intern-Decision-4B, sigue siendo generativo y sigue siendo la herramienta equivocada para una decisión de conjunto cerrado en volumen — pero es la opción intermedia, y la única de las tres que es realmente barata y realmente capaz a la vez.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

Leyendo honestamente la propia tabla de benchmarks de InternLM

La tarjeta de Intern-Decision-4B incluye una tabla comparativa, y lo que está ausente de ella es más informativo que lo que contiene. Las filas son Jev, Laya, SemIf, Kev, JevK5 y los propios 0.8B y 2B de InternLM. Cada una de esas es otra entrada de System One o de modelo de decisión — Jev de TypeSafe AI, Laya de Convai Innovations y otras tres. Cada cifra es reportada por el proveedor en los propios arneses de InternLM. No hay ningún modelo frontera en la tabla en absoluto.

Eso no es un descuido. Es el alcance honesto de la afirmación. El promedio principal de Intern-Decision-4B de 90.02 en siete suites — Jevbench-Easy 100.00, Jevbench-Original 98.61, Jevbench-Hard 73.87, Typed Decision 80.55, ToolACE 96.45, AG News 90.82, WildJailBreak 89.86 — es una afirmación de liderar la categoría de modelos de decisión, lo cual logra en esta tabla, superando el 88.74 de Jev y el 57.77 de Laya. No es una afirmación de competir con Qwen 3.8, y InternLM no hace esa afirmación en ningún lugar. La ficha del modelo se limita a su propia categoría, y leer una victoria de categoría como una victoria de capacidad es el error que esta sección existe para prevenir.

Dos advertencias más. Las cifras de latencia —44 ms de media en una 4090— las mide el proveedor, dependen de la carga de trabajo y del hardware, y un forward pass en una sola GPU no es la misma medición que una llamada a una API alojada que incluye el round-trip de red y el encolamiento. Y el piloto de calibración son 96 casos: un diagnóstico, no un benchmark, y la ficha lo dice.

La cuestión del despliegue, que es la verdadera bifurcación

Olvida los benchmarks por un momento y pregúntate qué te exige cada uno a nivel operativo.

Intern-Decision-4B ocupa aproximadamente 9,1 GB en disco en bf16 — dos fragmentos de lenguaje de 4,26 GB y 4,15 GB, una torre de visión de 612 MB y un proyector de 54 MB. Se carga mediante un inference.py de 16 KB incluido en el propio repositorio, con una DecisionEngine clase que instancias una vez y reutilizas. Un diccionario de Python de entrada, un diccionario de respuesta de salida, con un requisito de Python 3.12+. Se ejecuta en 44 ms en una 4090, y el hermano de 0.8B es lo suficientemente pequeño como para razonar con mucho menos. Pero el módulo es la interfaz — no hay servidor, ni endpoint compatible con OpenAI, ni API alojada. Estás construyendo el servicio a su alrededor, y si necesitas dos de ellos para conmutación por error, también estás construyendo eso.

El lado generativo del mismo pipeline es una decisión totalmente distinta, y es aquello para lo que sirve realmente un router. Qwen3.8-Max y Qwen3.8-27B se pueden invocar ambos en OrcaRouter con la misma clave compatible con OpenAI, al precio de lista del proveedor con un 0 % de recargo aplicado — así que cuando Alibaba cambia el precio de un Qwen, se aplica en nuestro lado el mismo día en lugar de en el siguiente ciclo de facturación. Intern-Decision-4B no es una de nuestras rutas y no lo será hasta que InternLM lo aloje en algún sitio; no vamos a fingir lo contrario. Lo que cubrimos es la mitad de este pipeline que consiste en una llamada de red: una clave para más de 200 modelos, conmutación automática por error si Qwen3.8-Max se degrada —su tasa de error en vivo de siete días es del 1,78 %— y la capacidad de comparar A/B los dos niveles de Qwen 3.8 entre sí en la misma ruta de solicitud antes de que te decidas por uno de los dos.

¿Cuál es el patrón que vale la pena extraer? Ejecuta el puntuador localmente porque es barato, rápido y hace bien una única cosa concreta. Enruta el paso de razonamiento, porque es ahí donde ocurren de verdad la rotación de proveedores, los recortes de precios y las interrupciones.

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

Cuál deberías elegir en realidad

Elige Intern-Decision-4B si tu decisión es de conjunto cerrado, tus respuestas son enumerables en un prompt, ejecutas la misma decisión a volumen y te importa la probabilidad tanto como la etiqueta. Enrutamiento de tickets, moderación de contenido contra una taxonomía fija, extracción estructurada a un esquema que controlas, rúbricas de calificación, compuertas binarias: cualquier cosa en la que un humano podría haber escrito la lista de opciones de antemano. Los 4.54 mil millones de parámetros son honestos sobre el techo: la propia tarjeta muestra el 4B en 73.87 en Jevbench-Hard frente a 100.00 en Easy, así que cuanto más difícil es la forma de la decisión, más cede el modelo pequeño.

Elige Qwen 3.8 —es decir, Qwen3.8-Max si quieres el núcleo alojado, Qwen3.8-27B si quieres pesos que puedas tener— si la respuesta no se puede enumerar de antemano, si la entrada tiene más de 8.192 tokens, si necesitas una justificación que puedas mostrarle a una persona, si necesitas llamadas a herramientas o si necesitas video. También elígelo si simplemente no quieres operar una GPU: 12,3 horas de tiempo de 4090 por millón de decisiones es barato solo si ya tienes la 4090 y algo más que hacer con ella los otros 363 días.

Elige ambos si tu pipeline tiene la forma que en realidad tienen la mayoría de los pipelines: un clasificador barato de conjunto cerrado delante y un modelo de frontera detrás para los casos en los que el clasificador no está seguro. Esa es la configuración para la que se creó la confianza calibrada de Intern-Decision-4B, y es la razón por la que el número ECE anterior importa más que el promedio principal.

Qué ver

Tres preguntas abiertas, todas respondibles en cuestión de días. ¿Publica InternLM el repositorio de GitHub al que enlaza su propia tarjeta —actualmente un 404— y, junto con él, una descripción del entrenamiento? ¿Sigue un anuncio a los pesos, convirtiendo una subida silenciosa en un lanzamiento documentado? ¿Y algo independiente reproduce el promedio de 90.02, o el Brier de 0.347, en hardware que no sea de InternLM?

Hay una pequeña inconsistencia que conviene señalar mientras esperas, porque es el tipo de cosa que importa cuando estás dimensionando un despliegue. El modelo se llama 4B. El recuento de parámetros es 4.539.265.536 — 4,54 mil millones. El hermano de 0,8B tiene 853 millones y el hermano de 2B tiene 2,21 mil millones, ambos redondeando hacia arriba o hacia abajo por un pelo. Solo el 4B redondea hacia abajo en más de 500 millones. No es un problema. Es un recordatorio de que, en un lanzamiento no anunciado, la documentación es la única especificación que tienes, y que incluso esa documentación todavía se está editando.