
Microsoft-Decision-1 vs Intern-Decision-0.8B: Media onza de problemas de jailbreak contra un espacio alojado en blanco
- OrcaNUEVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens · 55 tok/s
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
Empecemos por la columna que un anuncio de lanzamiento habría omitido. Intern-Decision-0.8B — el modelo de decisión de InternLM de 852.985.920 parámetros, ajustado a partir de Qwen3.5-0.8B y subido a Hugging Face el 26 de septiembre de 2026 sin anuncio, sin paper y con un enlace de GitHub que sigue dando 404 — se mide en 64,48 en WildJailBreak frente a una referencia de 96,29 para Jev 1.13 de TypeSafe. Eso no es una diferencia de redondeo. Es un colapso de la robustez de rechazo en un modelo cuyo trabajo entero es juzgar entradas, publicado en la propia ficha del proveedor, en una tabla cuyo benchmark pertenece a un competidor. Ponga eso junto a Microsoft-Decision-1, que pasó a disponibilidad general en Microsoft Foundry el 8 de octubre de 2026 como un evaluador de solo texto posentrenado sobre Qwen3.5-9B con una metodología de evaluación documentada y ni un solo resultado impreso debajo, y ya tiene la verdadera forma de este enfrentamiento. Uno de estos modelos le dirá un número que lo deja mal parado. El otro le dice qué métricas habría usado.
Esa inversión vale más que la hoja de especificaciones. Ambos modelos toman un estado y un conjunto acotado de preguntas y devuelven probabilidades sobre tus opciones: ninguno genera texto y, en ese eje, son el mismo tipo de instrumento. Las diferencias que importan son quién lo ejecuta, qué tan grande es, cuánto puedes verificar y una columna de seguridad que el modelo más pequeño, más silencioso y totalmente descargable decidió publicar de todos modos.
Lo que cada uno realmente devuelve
Microsoft-Decision-1 es una API alojada, y esa es la primera diferencia estructural. Los pesos no se distribuyen —sin descarga, sin repositorio, sin ruta de ajuste fino— y la integración implica una implementación de Foundry con autenticación, facturación y gobernanza de Azure incorporadas. Realiza una pasada sobre hasta 32.768 tokens, admite preguntas de sí/no, opción múltiple, calificación, clasificación y con forma de rúbrica, y es solo texto de entrada y numérico de salida. Admite explícitamente una opción de abstención como "no se puede determinar" cuando la evidencia es insuficiente, que es lo que hace que un umbral sea significativo.
Intern-Decision-0.8B es la disposición opuesta. Son pesos Apache 2.0 con la licencia upstream de Qwen conservada junto a ellos como LICENSE-QWEN, aproximadamente 1.73 GB de repositorio en tres fragmentos — un fragmento de lenguaje de 1.50 GB, un fragmento de visión de 176 MB y un proyector de 25 MB — que cabe en una sola GPU de consumo o en un portátil bien equipado. Acepta un estado, un esquema de una a dieciséis preguntas con nombre y hasta 62 opciones cada una, y, opcionalmente, hasta ocho imágenes, y su inference.py incluido documenta el contrato con más detalle del que la mayoría de los modelos lanzados se toma la molestia de incluir: las opciones se asignan a símbolos de un solo token A–Z, luego a–z, luego 0–9; los logits se leen en la posición inmediatamente anterior a cada <decision> de marcador de posición en un esqueleto pre-renderizado; se calcula una softmax solo sobre los candidatos legales de ese campo; se aplica una temperatura ajustada.
Las dos licencias no son la misma compra. Microsoft-Decision-1 te da un endpoint gestionado y ningún artefacto que te pertenezca. Intern-Decision-0.8B te da un artefacto que te pertenece, sin endpoint, sin contrato de soporte y sin documentación más allá del propio repositorio.

El techo, y la calibración que puedes auditar
Dos números deciden la mayoría de las integraciones reales, y ambos pertenecen al modelo pequeño.
El primero es 8,192 tokens. El motor de inferencia de Intern-Decision-0.8B rechaza las entradas de tamaño excesivo en lugar de truncarlas, que es el comportamiento correcto para un evaluador y también un muro infranqueable: no existe ninguna estrategia de fragmentación que preserve el contrato, porque el estado, el esquema y el esqueleto tienen que estar todos en una sola pasada. El límite máximo de Microsoft-Decision-1 es cuatro veces mayor, 32,768, y es un límite alojado que se puede elevar aprovisionando de otro modo en lugar de una constante en un archivo de Python.
El segundo es la calibración, y aquí la dirección se invierte. InternLM publica una temperatura ajustada de 2,747760550703 para el 0,8B, seleccionada mediante minimización de NLL sobre 1.728 casos de calibración designados, con 1.693 reservados para validación, y con la tarjeta explícita de que no se utilizaron las etiquetas del conjunto de pruebas para seleccionarla. La transformación aplicada es un softmax sobre los logits candidatos del campo seguido de un segundo softmax sobre el logaritmo de esa distribución dividido por la temperatura. Dado que la transformación se ejecuta después del primer softmax y preserva el orden, no puede cambiar el argmax en absoluto; mueve la confianza, la probabilidad de sí y el valor esperado de una pregunta de puntuación, y deja la etiqueta idéntica. Si tu canalización lee la etiqueta, la temperatura no tiene efecto. Si lee la probabilidad, la umbraliza o la introduce en un cálculo de valor esperado, la temperatura es la diferencia entre un número que significa algo y uno que no. Pasar temperature=1 devuelve la distribución no calibrada si prefieres ajustar la tuya.
Microsoft-Decision-1 no tiene un artefacto equivalente. Su pestaña Benchmarks indica que la precisión, el error de calibración, el recall de seguridad, las tasas de falsos positivos y la consistencia de equidad se midieron con benchmarks de decisiones públicos y comunitarios, además de conjuntos de prueba internos reservados; que se varió el orden de las opciones; que se aplicaron pruebas estadísticas pareadas; y que el modelo "tiene un rendimiento a la par de los principales modelos de decisión y por delante de otros modelos de decisión abiertos evaluados con la misma metodología". No se imprime ningún error de calibración, no hay temperatura que inspeccionar y no se describe ninguna división de validación. La única propiedad que hace útil a una probabilidad —si 0,8 significa 0,8— se afirma y no se cuantifica.
Lea esos dos párrafos en contraste y la comparación deja de girar en torno al tamaño. Un checkpoint de 0,8 mil millones de parámetros cuya calibración puede inspeccionar y cuyo software puede ejecutar es, para un equipo de evaluación, un objeto más manejable que una API alojada cuya calibración es una frase. El modelo pequeño también tiene una cifra de latencia registrada —33,98 ms de media, 33,44 ms de mediana, 37,50 ms de p95 por consulta en una sola RTX 4090 a través de la ruta local de Hugging Face, en la propia medición de InternLM—, mientras que la de Microsoft es algo que se mide a través de su propio despliegue, donde la elección entre sin servidor y rendimiento aprovisionado moverá la cifra más de lo que lo hará el modelo.

Donde el modelo pequeño pierde
Ninguna de las anteriores convierte a Intern-Decision-0.8B en la elección segura, y la misma tabla publicada dice por qué. WildJailBreak en 64.48 frente al 96.29 de Jev es una brecha de robustez ante rechazos de treinta puntos en la categoría exacta donde un evaluador se enfrenta a entradas no confiables. Un modelo de decisión suele ser el componente que decide si se permite una acción propuesta; uno al que es fácil pasar por alto es una responsabilidad en ese puesto. Si el déficit proviene de la base Qwen3.5-0.8B, del objetivo de ajuste para decisiones o del pequeño número de parámetros no es algo que el repositorio te diga, y no hay ningún artículo, ninguna receta de entrenamiento ni ninguna divulgación de datos que lo haría.
El resto de la propia tabla de InternLM es más halagadora que esa columna y aun así modesta. El promedio en siete suites es de 79,38 para el 0,8B frente a 84,68 para su propio hermano 2B y 90,02 para el 4B — la familia aumenta de forma pronunciada con el tamaño, lo que es una señal leve de que no se le hizo ingeniería inversa a la tabla para halagar al buque insignia. AG News se sitúa en 88,61 frente a 89,57 de Jev, prácticamente empatados en clasificación de temas en cuatro categorías. En calibración, el 0,8B reporta un Brier de 0,530 y un error de calibración esperado de 0,066, frente a 0,358 y 0,095 de Jev — mejor ECE, exactitud notablemente peor. Ese es un perfil plausible para un modelo pequeño con una temperatura ajustada deliberadamente, y no es una combinación que un equipo de marketing elegiría publicar por accidente.
Tampoco hay fecha de lanzamiento, ni anuncio, ni colección que reúna los tres checkpoints, ni endpoint alojado en ninguna parte, ni evaluación independiente de ningún tipo. El Space de demostración responde 401. La descripción correcta de Intern-Decision-0.8B es un checkpoint publicado con afirmaciones no auditadas — lo cual es una situación mejor que una API en lista de espera, porque puedes medirlo en una tarde, pero significa que la carga de validación es enteramente tuya.
Elegir, y dónde se sitúa OrcaRouter
Tome Microsoft-Decision-1 si el bloqueo es la adquisición o la escala: necesita autenticación de Azure, facturación unificada y una evaluación de IA responsable antes de que algo llegue a producción; necesita un contexto de 32K; necesita un punto de conexión que usted no opera; o necesita que la ruta de abstención esté diseñada de forma integrada en lugar de hecha a mano. Acepte a cambio que no puede ejecutarlo, no puede ajustarlo, no puede inspeccionar su calibración y estará midiendo su afirmación central usted mismo.
Elige Intern-Decision-0.8B si el obstáculo es el coste, la memoria o el control: quieres un puntuador con licencia Apache-2.0 que quepa en 1.73 GB, se ejecute en hardware que ya posees, produzca la misma etiqueta cada vez y pueda cambiarse por su hermano de 2B o 4B cambiando una ruta de checkpoint. Acepta a cambio la barrera de 8,192 tokens, la columna WildJailBreak y el hecho de que nadie fuera de InternLM haya reproducido nada en la tarjeta.
La recomendación honesta es hacer ambas cosas, porque son lo bastante baratas como para que la discusión apenas merezca la pena. La llamada de calificación en sí no es algo que enrutemos —un modelo que devuelve probabilidades en lugar de texto no es una finalización de chat, y ninguna de estas está en nuestro catálogo. Lo que OrcaRouter ofrece es la otra mitad del bucle: los más de 200 modelos detrás de una única clave compatible con OpenAI que redactan la rúbrica, generan las respuestas candidatas o emiten la llamada a herramienta que tu calificador está a punto de calificar, al precio de lista del proveedor trasladado con un 0 % de margen, por lo que una rebaja del precio de un generador por parte del proveedor está activa de nuestro lado el mismo día. La conmutación automática por error importa más de lo habitual aquí, porque una canalización que califica todo lo que ve no tiene margen para reintentar una llamada atascada, y el DSL de enrutamiento te permite enviar un mismo prompt de juez a varios redactores y fusionar el acuerdo entre ellos en lugar de confiar en uno solo.

En resumen
Microsoft-Decision-1 alcanzó disponibilidad general en Microsoft Foundry el 8 de octubre de 2026: alojado, solo texto, 32.768 tokens, construido sobre Qwen3.5-9B, con un párrafo de metodología en lugar de una tabla de benchmarks. Intern-Decision-0.8B es un checkpoint de 1,73 GB con licencia Apache-2.0 subido el 26 de septiembre de 2026 que publica un Brier de 0,530, un ECE de 0,066, una temperatura ajustada de 2,747760550703, 33,98 ms en una 4090 — y una puntuación de WildJailBreak de 64,48 que nadie le pidió que imprimiera. Si solo puedes validar una cosa antes de adoptar cualquiera de los dos, valida la calibración con tus propios casos etiquetados; ese es el número que ambos proveedores han dejado para que lo encuentres.
