Una tarjeta de título generada para Microsoft-Decision-1 vs. Intern-Decision-0.8B, con el subtítulo «un scorer alojado sin números frente a un checkpoint de 1,73 GB con uno poco favorecedor», con chips que indican un endpoint de Foundry frente a 852.985.920 parámetros, un párrafo de metodología frente a una puntuación de WildJailBreak de 64,48, y 32.768 tokens frente a un techo de 8.192.
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-0.8B: Media onza de problemas de jailbreak contra un espacio alojado en blanco

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Empecemos por la columna que un anuncio de lanzamiento habría omitido. Intern-Decision-0.8B — el modelo de decisión de InternLM de 852.985.920 parámetros, ajustado a partir de Qwen3.5-0.8B y subido a Hugging Face el 26 de septiembre de 2026 sin anuncio, sin paper y con un enlace de GitHub que sigue dando 404 — se mide en 64,48 en WildJailBreak frente a una referencia de 96,29 para Jev 1.13 de TypeSafe. Eso no es una diferencia de redondeo. Es un colapso de la robustez de rechazo en un modelo cuyo trabajo entero es juzgar entradas, publicado en la propia ficha del proveedor, en una tabla cuyo benchmark pertenece a un competidor. Ponga eso junto a Microsoft-Decision-1, que pasó a disponibilidad general en Microsoft Foundry el 8 de octubre de 2026 como un evaluador de solo texto posentrenado sobre Qwen3.5-9B con una metodología de evaluación documentada y ni un solo resultado impreso debajo, y ya tiene la verdadera forma de este enfrentamiento. Uno de estos modelos le dirá un número que lo deja mal parado. El otro le dice qué métricas habría usado.

Esa inversión vale más que la hoja de especificaciones. Ambos modelos toman un estado y un conjunto acotado de preguntas y devuelven probabilidades sobre tus opciones: ninguno genera texto y, en ese eje, son el mismo tipo de instrumento. Las diferencias que importan son quién lo ejecuta, qué tan grande es, cuánto puedes verificar y una columna de seguridad que el modelo más pequeño, más silencioso y totalmente descargable decidió publicar de todos modos.

Lo que cada uno realmente devuelve

Microsoft-Decision-1 es una API alojada, y esa es la primera diferencia estructural. Los pesos no se distribuyen —sin descarga, sin repositorio, sin ruta de ajuste fino— y la integración implica una implementación de Foundry con autenticación, facturación y gobernanza de Azure incorporadas. Realiza una pasada sobre hasta 32.768 tokens, admite preguntas de sí/no, opción múltiple, calificación, clasificación y con forma de rúbrica, y es solo texto de entrada y numérico de salida. Admite explícitamente una opción de abstención como "no se puede determinar" cuando la evidencia es insuficiente, que es lo que hace que un umbral sea significativo.

Intern-Decision-0.8B es la disposición opuesta. Son pesos Apache 2.0 con la licencia upstream de Qwen conservada junto a ellos como LICENSE-QWEN, aproximadamente 1.73 GB de repositorio en tres fragmentos — un fragmento de lenguaje de 1.50 GB, un fragmento de visión de 176 MB y un proyector de 25 MB — que cabe en una sola GPU de consumo o en un portátil bien equipado. Acepta un estado, un esquema de una a dieciséis preguntas con nombre y hasta 62 opciones cada una, y, opcionalmente, hasta ocho imágenes, y su inference.py incluido documenta el contrato con más detalle del que la mayoría de los modelos lanzados se toma la molestia de incluir: las opciones se asignan a símbolos de un solo token A–Z, luego a–z, luego 0–9; los logits se leen en la posición inmediatamente anterior a cada <decision> de marcador de posición en un esqueleto pre-renderizado; se calcula una softmax solo sobre los candidatos legales de ese campo; se aplica una temperatura ajustada.

Las dos licencias no son la misma compra. Microsoft-Decision-1 te da un endpoint gestionado y ningún artefacto que te pertenezca. Intern-Decision-0.8B te da un artefacto que te pertenece, sin endpoint, sin contrato de soporte y sin documentación más allá del propio repositorio.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

El techo, y la calibración que puedes auditar

Dos números deciden la mayoría de las integraciones reales, y ambos pertenecen al modelo pequeño.

El primero es 8,192 tokens. El motor de inferencia de Intern-Decision-0.8B rechaza las entradas de tamaño excesivo en lugar de truncarlas, que es el comportamiento correcto para un evaluador y también un muro infranqueable: no existe ninguna estrategia de fragmentación que preserve el contrato, porque el estado, el esquema y el esqueleto tienen que estar todos en una sola pasada. El límite máximo de Microsoft-Decision-1 es cuatro veces mayor, 32,768, y es un límite alojado que se puede elevar aprovisionando de otro modo en lugar de una constante en un archivo de Python.

El segundo es la calibración, y aquí la dirección se invierte. InternLM publica una temperatura ajustada de 2,747760550703 para el 0,8B, seleccionada mediante minimización de NLL sobre 1.728 casos de calibración designados, con 1.693 reservados para validación, y con la tarjeta explícita de que no se utilizaron las etiquetas del conjunto de pruebas para seleccionarla. La transformación aplicada es un softmax sobre los logits candidatos del campo seguido de un segundo softmax sobre el logaritmo de esa distribución dividido por la temperatura. Dado que la transformación se ejecuta después del primer softmax y preserva el orden, no puede cambiar el argmax en absoluto; mueve la confianza, la probabilidad de sí y el valor esperado de una pregunta de puntuación, y deja la etiqueta idéntica. Si tu canalización lee la etiqueta, la temperatura no tiene efecto. Si lee la probabilidad, la umbraliza o la introduce en un cálculo de valor esperado, la temperatura es la diferencia entre un número que significa algo y uno que no. Pasar temperature=1 devuelve la distribución no calibrada si prefieres ajustar la tuya.

Microsoft-Decision-1 no tiene un artefacto equivalente. Su pestaña Benchmarks indica que la precisión, el error de calibración, el recall de seguridad, las tasas de falsos positivos y la consistencia de equidad se midieron con benchmarks de decisiones públicos y comunitarios, además de conjuntos de prueba internos reservados; que se varió el orden de las opciones; que se aplicaron pruebas estadísticas pareadas; y que el modelo "tiene un rendimiento a la par de los principales modelos de decisión y por delante de otros modelos de decisión abiertos evaluados con la misma metodología". No se imprime ningún error de calibración, no hay temperatura que inspeccionar y no se describe ninguna división de validación. La única propiedad que hace útil a una probabilidad —si 0,8 significa 0,8— se afirma y no se cuantifica.

Lea esos dos párrafos en contraste y la comparación deja de girar en torno al tamaño. Un checkpoint de 0,8 mil millones de parámetros cuya calibración puede inspeccionar y cuyo software puede ejecutar es, para un equipo de evaluación, un objeto más manejable que una API alojada cuya calibración es una frase. El modelo pequeño también tiene una cifra de latencia registrada —33,98 ms de media, 33,44 ms de mediana, 37,50 ms de p95 por consulta en una sola RTX 4090 a través de la ruta local de Hugging Face, en la propia medición de InternLM—, mientras que la de Microsoft es algo que se mide a través de su propio despliegue, donde la elección entre sin servidor y rendimiento aprovisionado moverá la cifra más de lo que lo hará el modelo.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-0.8B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; weights not distributed; calibration error not published; latency not published. Right column Intern-Decision-0.8B rows read: availability uploaded September 26, 2026; parameters 852,985,920 in 1.73 GB; input ceiling 8,192 tokens with oversize input rejected; weights Apache 2.0 and self-serve; Brier 0.530 and ECE 0.066; 33.98 ms mean on a single RTX 4090. A footer line reads that the InternLM figures are vendor-reported on InternLM's own harness with no independent reproduction.

Donde el modelo pequeño pierde

Ninguna de las anteriores convierte a Intern-Decision-0.8B en la elección segura, y la misma tabla publicada dice por qué. WildJailBreak en 64.48 frente al 96.29 de Jev es una brecha de robustez ante rechazos de treinta puntos en la categoría exacta donde un evaluador se enfrenta a entradas no confiables. Un modelo de decisión suele ser el componente que decide si se permite una acción propuesta; uno al que es fácil pasar por alto es una responsabilidad en ese puesto. Si el déficit proviene de la base Qwen3.5-0.8B, del objetivo de ajuste para decisiones o del pequeño número de parámetros no es algo que el repositorio te diga, y no hay ningún artículo, ninguna receta de entrenamiento ni ninguna divulgación de datos que lo haría.

El resto de la propia tabla de InternLM es más halagadora que esa columna y aun así modesta. El promedio en siete suites es de 79,38 para el 0,8B frente a 84,68 para su propio hermano 2B y 90,02 para el 4B — la familia aumenta de forma pronunciada con el tamaño, lo que es una señal leve de que no se le hizo ingeniería inversa a la tabla para halagar al buque insignia. AG News se sitúa en 88,61 frente a 89,57 de Jev, prácticamente empatados en clasificación de temas en cuatro categorías. En calibración, el 0,8B reporta un Brier de 0,530 y un error de calibración esperado de 0,066, frente a 0,358 y 0,095 de Jev — mejor ECE, exactitud notablemente peor. Ese es un perfil plausible para un modelo pequeño con una temperatura ajustada deliberadamente, y no es una combinación que un equipo de marketing elegiría publicar por accidente.

Tampoco hay fecha de lanzamiento, ni anuncio, ni colección que reúna los tres checkpoints, ni endpoint alojado en ninguna parte, ni evaluación independiente de ningún tipo. El Space de demostración responde 401. La descripción correcta de Intern-Decision-0.8B es un checkpoint publicado con afirmaciones no auditadas — lo cual es una situación mejor que una API en lista de espera, porque puedes medirlo en una tarde, pero significa que la carga de validación es enteramente tuya.

Elegir, y dónde se sitúa OrcaRouter

Tome Microsoft-Decision-1 si el bloqueo es la adquisición o la escala: necesita autenticación de Azure, facturación unificada y una evaluación de IA responsable antes de que algo llegue a producción; necesita un contexto de 32K; necesita un punto de conexión que usted no opera; o necesita que la ruta de abstención esté diseñada de forma integrada en lugar de hecha a mano. Acepte a cambio que no puede ejecutarlo, no puede ajustarlo, no puede inspeccionar su calibración y estará midiendo su afirmación central usted mismo.

Elige Intern-Decision-0.8B si el obstáculo es el coste, la memoria o el control: quieres un puntuador con licencia Apache-2.0 que quepa en 1.73 GB, se ejecute en hardware que ya posees, produzca la misma etiqueta cada vez y pueda cambiarse por su hermano de 2B o 4B cambiando una ruta de checkpoint. Acepta a cambio la barrera de 8,192 tokens, la columna WildJailBreak y el hecho de que nadie fuera de InternLM haya reproducido nada en la tarjeta.

La recomendación honesta es hacer ambas cosas, porque son lo bastante baratas como para que la discusión apenas merezca la pena. La llamada de calificación en sí no es algo que enrutemos —un modelo que devuelve probabilidades en lugar de texto no es una finalización de chat, y ninguna de estas está en nuestro catálogo. Lo que OrcaRouter ofrece es la otra mitad del bucle: los más de 200 modelos detrás de una única clave compatible con OpenAI que redactan la rúbrica, generan las respuestas candidatas o emiten la llamada a herramienta que tu calificador está a punto de calificar, al precio de lista del proveedor trasladado con un 0 % de margen, por lo que una rebaja del precio de un generador por parte del proveedor está activa de nuestro lado el mismo día. La conmutación automática por error importa más de lo habitual aquí, porque una canalización que califica todo lo que ve no tiene margen para reintentar una llamada atascada, y el DSL de enrutamiento te permite enviar un mismo prompt de juez a varios redactores y fusionar el acuerdo entre ellos en lugar de confiar en uno solo.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

En resumen

Microsoft-Decision-1 alcanzó disponibilidad general en Microsoft Foundry el 8 de octubre de 2026: alojado, solo texto, 32.768 tokens, construido sobre Qwen3.5-9B, con un párrafo de metodología en lugar de una tabla de benchmarks. Intern-Decision-0.8B es un checkpoint de 1,73 GB con licencia Apache-2.0 subido el 26 de septiembre de 2026 que publica un Brier de 0,530, un ECE de 0,066, una temperatura ajustada de 2,747760550703, 33,98 ms en una 4090 — y una puntuación de WildJailBreak de 64,48 que nadie le pidió que imprimiera. Si solo puedes validar una cosa antes de adoptar cualquiera de los dos, valida la calibración con tus propios casos etiquetados; ese es el número que ambos proveedores han dejado para que lo encuentres.