Una tarjeta de título generada para Microsoft-Decision-1 vs Intern-Decision-4B, subtitulada «dos puntuadores, uno con números y otro sin ellos», con chips que dicen 9B vs 4B, API alojada vs pesos abiertos, sin benchmarks publicados vs Brier 0.347 y ECE 0.065, y un pie de página de fuentes que señala que las cifras de Microsoft no están reproducidas y las cifras de InternLM son reportadas por el proveedor.
Guides & Insights

Microsoft-Decision-1 vs. Intern-Decision-4B: Uno publica su calibración, el otro publica su metodología

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pon Microsoft-Decision-1 junto a Intern-Decision-4B y obtienes una comparación que se decide menos por la capacidad que por lo que cada proveedor estuvo dispuesto a publicar. El modelo de Microsoft alcanzó la disponibilidad general en Microsoft Foundry el 8 de octubre de 2026: una base Qwen3.5-9B, entrenada posteriormente por Microsoft, solo texto, contexto de 32.768 tokens, pesos no distribuidos, una metodología de evaluación que describe exactitud, error de calibración y pruebas estadísticas pareadas — y ni un solo resultado. El Intern-Decision-4B de InternLM se publicó en Hugging Face el 26 de septiembre de 2026 a las 05:36:37 UTC sin ningún anuncio detrás, es un ajuste fino de Qwen3.5-4B, acepta imágenes además de texto, se ejecuta en 44 milisegundos en una sola RTX 4090 y muestra una tabla completa de cifras de Brier y de error de calibración esperado. Ambos devuelven una distribución de probabilidad sobre las opciones que proporciones. Solo uno de ellos te dice lo bien que lo hace.

Esa inversión —que el modelo más grande y mejor financiado sea el opaco— es toda la esencia de este enfrentamiento, y decide la elección para la mayoría de los equipos más rápido que cualquier línea de especificación.

El único número que los separa

InternLM informa Brier 0.347 y ECE 0.065 para Intern-Decision-4B en su conjunto de pruebas comparativas, con una puntuación media de 90.02 en Jevbench-Easy (100.00), Jevbench-Original (98.61), Jevbench-Hard (73.87), Typed Decision (80.55), ToolACE (96.45), AG News (90.82) y WildJailBreak (89.86). Son cifras reportadas por el proveedor en el propio banco de pruebas del proveedor y, en particular, las filas de Jevbench pertenecen a la propia familia de pruebas comparativas del proyecto; léelas como una autoevaluación, no como una verificación independiente. Pero son números con una escala declarada, y el ECE en particular es la cifra que te indica si un 0.8 devuelto merece que se actúe en consecuencia.

Microsoft no publica ningún equivalente. La pestaña Benchmarks de la página de catálogo de Microsoft-Decision-1 describe lo que se midió y afirma que el modelo "rinde a la par de los principales modelos de decisión y por delante de otros modelos de decisión abiertos evaluados con la misma metodología", con las áreas más fuertes nombradas como razonamiento, aplicación de reglas y robustez del formato de prompt, y las más débiles como conocimiento especializado del dominio. Sin Brier, sin ECE, sin tabla de exactitud. Si tu decisión de adopción necesita una cifra de calibración antes de poder dimensionar un umbral de escalado, uno de estos dos modelos te la da y el otro te pide que la midas tú mismo.

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

En lo que realmente difieren los dos contratos.

En apariencia, estos modelos aceptan la misma llamada. Tú proporcionas un estado, un esquema de preguntas con nombre y un conjunto fijo de opciones; recibes como resultado una probabilidad por opción sin un solo token de texto generado. Las diferencias aparecen en los límites de ese contrato.

• Modalidad — Microsoft-Decision-1 es explícitamente solo texto y no acepta ni produce contenido de imagen, audio o vídeo. Intern-Decision-4B acepta imágenes opcionales junto con el estado, hasta ocho por llamada, lo que lo convierte en un candidato para la clasificación de capturas de pantalla, la verificación del diseño de documentos y el enrutamiento de QA visual.

• Cardinalidad de preguntas — InternLM documenta de 1 a 16 preguntas por llamada, hasta 62 opciones cada una, en tres tipos de campo (opción, puntuación, noul). Microsoft documenta los formatos — sí/no, opción múltiple, valoración, clasificación, rúbrica — y una única invocación de hasta 32K tokens, pero no un límite máximo de preguntas por llamada.

• Contexto — Microsoft indica 32.768 tokens. La ficha de Intern-Decision-4B expresa sus límites en preguntas, opciones e imágenes en lugar de como una sola cifra de contexto, así que no puedes comparar ambos con un único número.

• Distribución — Microsoft-Decision-1 es una API alojada de Foundry; los pesos del modelo no se distribuyen y no hay descarga. Intern-Decision-4B es Apache-2.0 en Hugging Face con la licencia upstream de Qwen conservada como LICENSE-QWEN, lo que significa conservar esa licencia y los avisos upstream si lo redistribuyes.

• Perfil de coste — Los pesos de InternLM no cuestan nada de ejecutar y se cotizan en 44,16 ms de media y 44,60 ms en el P95, en una sola RTX 4090. El precio por token de Microsoft no aparece impreso en la página del modelo en absoluto.

• Gobernanza — Microsoft ofrece una evaluación de IA responsable, prácticas de despliegue documentadas y exclusiones explícitas (no para la generación de texto, preguntas y respuestas abiertas, conversación, traducción o resumen; no para ser el único decisor automatizado en decisiones de gran impacto sobre las personas). InternLM ofrece una tarjeta de modelo que es sincera en cuanto a su procedencia —pesos «modificados por ajuste de decisiones»— y nada que se parezca a un paquete de cumplimiento.

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

Dos razones muy diferentes por las que es difícil comparar las cifras de latencia

Microsoft-Decision-1 no publica una cifra de latencia, así que no hay nada que poner junto a la media de 44,16 ms de InternLM. Esa no es una omisión menor para esta carga de trabajo. Estos modelos existen para ser llamados muchas veces dentro de un pipeline —una vez por cada documento recuperado, una vez por cada llamada a herramienta propuesta, una vez por cada respuesta que se califica—, y la diferencia entre cuatro decisiones por segundo y cuarenta es la diferencia entre puntuar una muestra y puntuarlo todo. La cifra de InternLM se puede alcanzar hoy en hardware que puedes alquilar por horas; la de Microsoft tiene que medirse a través de tu propia implementación de Foundry, y la forma de implementación que elijas (serverless de pago por uso frente a rendimiento aprovisionado) la cambiará más que el propio modelo.

Aquí también es donde la mitad de OrcaRouter del patrón se vuelve relevante, y es solo la mitad generativa. No alojamos Microsoft-Decision-1 ni Intern-Decision-4B — un modelo que devuelve probabilidades en lugar de texto no es algo a lo que se enruten las completaciones de chat, y ninguno aparece en nuestro catálogo. Lo que está detrás de nuestra única clave compatible con OpenAI es el grupo de más de 200 modelos que se encarga de la escritura: el prompt del juez redactado por un modelo, las respuestas candidatas producidas por otros dos, la llamada a la herramienta que se puntúa antes de ejecutarse. El precio de lista del proveedor se pasa con un margen del 0 %, por lo que un recorte de precio en un generador está activo en nuestro lado el mismo día, y la conmutación por error automática mantiene viva la parte de generación de un bucle de puntuación cuando un solo proveedor se degrada — lo que importa más de lo habitual aquí, porque una canalización que puntúa todo lo que ve no tiene margen para reintentar una llamada estancada.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

¿Quién debería tomar cuál?

Elige Intern-Decision-4B si alguna de estas condiciones es cierta: necesitas puntuar imágenes además de texto, necesitas un número de calibración antes de poder lanzar, quieres la opción de ejecutar el modelo en tu propio hardware dentro de un perímetro que controles, o quieres ajustarlo con fine-tuning. El último punto merece énfasis: un scorer de pesos abiertos de 4B con un wrapper documentado es un modelo que puedes adaptar a tus propias etiquetas, y Microsoft-Decision-1 es una API alojada sin ruta de fine-tuning y sin pesos que adaptar.

Elige Microsoft-Decision-1 si el obstáculo es la adquisición y no el rendimiento: necesitas autenticación de Azure, facturación unificada, gobernanza y una evaluación de IA Responsable del proveedor antes de que algo llegue a producción, y necesitas un contexto de 32K para documentos largos que los límites por llamada del 4B complican. Su falta de benchmarks publicados es un costo real, pero es un costo que puedes eliminar en una tarde ejecutando tu propio conjunto etiquetado por ambos modelos y comparando el ECE —que es lo que harías de todos modos antes de confiar en la tabla de cualquiera de los proveedores.

La incómoda respuesta es que ambos son lo suficientemente baratos de probar como para que la discusión apenas merezca la pena. Intern-Decision-4B necesita una GPU que probablemente ya tienes. Microsoft-Decision-1 necesita un despliegue en Foundry y una muestra de tus propias decisiones etiquetadas. Pasa tus datos por ambos, calcula la calibración en el subconjunto que te importa y deja que los números decidan, lo cual, como corresponde, es exactamente para lo que sirven estos modelos.