Una tarjeta de título generada que dice «Intern-Decision-2B vs Qwen 3.8», con el subtítulo «Una columna vertebral, dos trabajos muy diferentes», con las insignias «puntuador de 2.2B, 33 ms» y «buque insignia de 2.4T, contexto de 1M», con el logotipo de OrcaRouter compuesto en la esquina.
Guides & Insights

Intern-Decision-2B vs Qwen 3.8: Un backbone, dos trabajos muy diferentes

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Abre la configuración de internlm/Intern-Decision-2B y la configuración de Qwen/Qwen3.5-2B lado a lado y casi nada difiere. Las mismas 24 capas, el mismo tamaño oculto de 2.048, las mismas 8 cabezas de consulta frente a 2 cabezas de clave-valor, la misma dimensión de cabeza de 256, el mismo techo de embeddings de 262.144 posiciones, el mismo vocabulario de 248.320 tokens, el mismo patrón repetido de tres capas de atención lineal por cada capa de atención completa. Intern-Decision-2B no es una nueva arquitectura. Es ese backbone con su capacidad de generar texto eliminada y su confianza calibrada — y esa única resta es lo que hace que la comparación contra Qwen3.8-Max, el buque insignia de 2,4 billones de parámetros al que se refiere todo el nombre de la familia «Qwe​n 3.8» en el extremo superior, valga más que una cuenta atrás de parámetros.

Los dos no son competidores y el enfrentamiento no es una contienda. Intern-Decision-2B es un fine-tune de 2.213.241.664 parámetros de Qwen3.5-2B, subido a Hugging Face a las 05:36 UTC del 26 de septiembre de 2026 entre tres hermanos no anunciados, y no emite tokens: recibe un estado y preguntas tipadas, ejecuta una única pasada forward causal, lee logits en posiciones fijas de marcador de posición y devuelve una distribución calibrada por campo. Qwen3.8-Max es el modelo insignia alojado de Alibaba, un modelo disperso de mezcla de expertos con aproximadamente 95 mil millones de parámetros activos por token, una ventana de contexto multimodal de 1 millón de tokens y precios de lista de 2,00 USD por millón de tokens de entrada y 6,00 USD por millón de salida. Uno es un componente. El otro es un servicio. La pregunta útil es dónde debe ubicarse la costura entre ambos en un pipeline por el que ya estás pagando.

La resta, precisamente

Lo que cambió el ajuste de decisiones merece decirse con exactitud, porque aclara lo que el modelo base ya traía consigo.

La tarea se denomina en el repositorio modelado de lenguaje enmascarado autorregresivo. La entrada del asistente contiene un esqueleto JSON completo con un token <decision> por campo; los símbolos de respuesta de referencia aparecen solo en las etiquetas, nunca en la entrada. El entrenamiento usa la alineación causal ordinaria de siguiente token, donde el logit inmediatamente anterior a un marcador predice la respuesta de ese campo, y todos los campos comparten una sola pasada hacia adelante. En inferencia, los logits se restringen a los símbolos de respuesta legales de un solo token —A–Z, a–z, 0–9, de donde proviene el límite de 62 opciones—, luego se les aplica softmax y se asignan de vuelta a tus etiquetas.

Así que el mecanismo del siguiente token del modelo base está intacto y sin modificar. Lo que se entrenó fue una preferencia por ocupar una de un puñado de posiciones de respuesta en lugar de continuar una oración, más una temperatura específica del checkpoint de 2,100509348278 ajustada mediante log-verosimilitud negativa sobre 1.728 casos de calibración designados, con 1.693 reservados. La tarjeta es inequívoca en que la generación queda descartada: la API «realiza una puntuación estructurada de candidatos. No llama a generate() ni muestrea texto de forma libre».

El repositorio también registra lo que el ajuste no tocó: «hace un ajuste fino sobre la columna vertebral lingüística de Qwen3.5 mientras congela la torre de visión y el proyector». El fragmento de visión de 612.517.440 bytes en el 2B tiene el mismo número de bytes que en el checkpoint de decisión 4B, lo que encaja con componentes heredados en lugar de entrenados. La ruta de imágenes funciona; simplemente no fue en lo que la pasada de decisión gastó su presupuesto.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, the opening description of the model as a multimodal structured decision model fine-tuned from Qwen3.5-2B, and the start of the five-step 'How inference works' list.

Lo que 2,2 mil millones de parámetros no pueden hacer, y lo que los 2,4 billones hacen en su lugar

Todo se divide según un único eje: si tu respuesta ya existe como lista.

Intern-Decision-2B responde a un conjunto cerrado. De una a dieciséis preguntas, hasta 62 opciones cada una, hasta ocho imágenes, todo dentro de un presupuesto de 8,192 tokens que el motor rechaza en lugar de truncar. Se devuelve como probabilidades. Con una media de 33.28 ms por solicitud en una única RTX 4090 y un P95 de 33.55 ms, y no se factura nada por llamada porque no hay ninguna salida que facturar.

Qwen3.8-Max escribe. Un contexto de 1 millón de tokens, entrada de texto, imagen y video, razonamiento con un modo de pensamiento, llamada nativa a herramientas, salidas estructuradas, hasta 131.000 tokens de salida en la compilación fechada 0902. También puede, en principio, tomar la misma decisión de enrutamiento que toma Intern-Decision-2B: puedes pedirle que elija entre opciones y devuelva JSON. Tres cosas salen mal cuando lo haces. Pagas por los tokens que gasta en decidir. Obtienes una cadena cuyo parseo puede tener éxito o no. Y el número dentro de esa cadena es lo que haya producido el muestreador, no un softmax al que puedas aplicar un umbral de 0,8 y actuar en consecuencia.

Ambas versiones son ciertas y ninguna anula a la otra. El modelo insignia de 2,4 billones de parámetros existe porque la mayoría de los problemas no son conjuntos cerrados. El evaluador de 2,2 mil millones de parámetros existe porque el subconjunto que sí lo es merece un instrumento más barato.

Marcador

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Qwen 3.8'. The left column reads: Parameters 2,213,241,664 in BF16; Context 8,192 tokens, refused above; Output probabilities and an argmax; Modality text plus up to 8 images; Cost no per-call charge, you own the GPU; Published evidence vendor table, unreproduced. The right column reads: Parameters about 2.4T total, 95B active; Context 1,000,000 tokens; Output generated text with a reasoning trace; Modality text, image and video; Cost $2.00 in / $6.00 out per million; Published evidence AA Index 45.4, rank 15 of 145. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Qwen3.8-Max figures are per Artificial Analysis and the vendor's public rate card.

• Parámetros — Intern-Decision-2B 2.213.241.664 en BF16 más una torre de visión y un proyector, unos 4,46 GB en disco; Qwen3.8-Max: aproximadamente 2,4 billones en total, con alrededor de 95.000 millones activos por token; se sirve, no se descarga.

• Contexto — 8,192 tokens, rechazado arriba; 1,000,000 tokens con una salida máxima de 131,000 en la compilación 0902.

• Salida — probabilidades calibradas y un argmax, sin texto generado; texto generado incluyendo una traza de razonamiento.

• Modalidades de entrada — texto más hasta ocho imágenes; texto, imagen y vídeo.

• Costo — sin cargo por llamada, y usted es dueño de la GPU; $2.00 por millón de tokens de entrada, $6.00 por millón de salida, con lecturas de caché a $0.25 y escrituras de caché a $2.50.

• Evidencia publicada — una tabla de siete suites de proveedor con un promedio de 84,68, Brier 0,437 y ECE 0,100 en 10.751 filas de prueba, que nadie fuera de InternLM ha reproducido, sobre un checkpoint con un me gusta y cero descargas; un Artificial Analysis Intelligence Index de 45,4 en el puesto 15 de 145 y un AA Coding index de 76,2 en el puesto 9 de 138, ambos medidos de forma independiente.

• Latencia — 33,28 ms de media por solicitud en una RTX 4090, que disminuye a medida que se añade procesamiento por lotes; 2,655 segundos P50 hasta el primer token, que sube con la carga, según lo reporta el catálogo.

Las filas de evidencia no son equivalentes y no deberían imprimirse como si lo fueran. El modelo insignia de Alibaba tiene detrás una puntuación de índice independiente. El checkpoint de InternLM tiene una tabla producida por sus propios autores, y la cifra de calibración, en especial, debería leerse como una intención bien documentada hasta que se contraste con datos de terceros —y más aún aquí, porque este tamaño en concreto registra el peor error de calibración esperado de los tres que InternLM lanzó: 0,100 frente a 0,066 para el modelo de la mitad de su tamaño y 0,065 para el que casi lo duplica.

La costura, y cómo ejecutarla

El pipeline que tiene sentido no es una elección entre estos dos, sino una división: el scorer se encarga de las decisiones enumeradas, y un modelo frontera se encarga de todo aquello cuya respuesta no es una lista. Un triaje de soporte que enruta a uno de seis equipos y califica la urgencia en una escala de tres puntos no necesita 95 000 millones de parámetros activos; necesita una probabilidad y un umbral. La ruta de escalado que acaba escribiéndole una respuesta al cliente, sí.

Esa división tiene una forma operativa. Intern-Decision-2B no está en OrcaRouter —nuestra página de modelo para él devuelve 404 y no hay ninguna ruta alojada en ningún sitio que hayamos podido encontrar—, así que se ejecuta en tu propio hardware, lo que significa que es un componente que tú operas y monitoreas. Qwen3.8-Max es una ruta: una sola clave para más de 200 modelos, con el precio de lista del proveedor pasado sin margen alguno, lo que significa que un cambio de precio del proveedor en el modelo insignia llega a tu factura el mismo día en que se produce. Poner la parte alojada del pipeline detrás de esa única superficie es lo que mantiene barata la parte más económica: el scorer mantiene bajo el volumen de llamadas, y solo se recurre al modelo de frontera para los casos que realmente lo necesitan.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen breadcrumb, the model name Qwen3.8 Max, the routing line reading qwen/qwen3.8-max with text, image and video input and text output, the Vision, Tools, JSON and Reasoning capability badges, a release line reading by Qwen - 2026-08-03, a P50 time to first token of 2.655 seconds, on-page navigation for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ, and the opening of the vendor description naming it Alibaba's newest flagship model.

Si todavía estás evaluando qué puntuador corresponde a esa ranura — este no tiene una evaluación independiente y su calibración es la más débil de su propia familia — conmutación automática por error entre proveedores es la forma de probarlo en una ruta que ya cuenta con una alternativa funcional detrás, en lugar de reemplazar esa alternativa por completo.

El veredicto sincero

Si tu problema es una decisión sobre un conjunto de respuestas que puedes enumerar, y el estado cabe dentro de ocho mil tokens, Intern-Decision-2B lo hará en treinta y tres milisegundos a coste cero por llamada, y ningún modelo de frontera le superará en ese eje por muchos parámetros que alquiles. Aplica tu propia calibración sobre él antes de depender de la confianza que reporta.

Si tu problema es cualquier otra cosa —razonamiento, contexto largo, uso de herramientas, vídeo, un documento de un millón de tokens o, simplemente, una respuesta que aún no se ha escrito—, Qwen3.8-Max no es simplemente mejor. Es el único de los dos que puede siquiera hacer el trabajo.

Y si todavía no puedes decir cuál de esos dos tienes, lo más probable es que tengas ambos, en el mismo pipeline, que es la arquitectura que los recuentos de parámetros te venían diciendo en voz baja desde el principio.