Una tarjeta de título generada para Microsoft-Decision-1 con el subtítulo «disponible de forma general, y sin una sola puntuación publicada», con una insignia que dice Microsoft Foundry, 8 de octubre de 2026, y chips que dicen Qwen3.5-9B base, contexto de 32,768 tokens, solo texto, cero tokens de salida y pesos no distribuidos.
Guides & Insights

Microsoft-Decision-1 ya está activo en Foundry. Su pestaña Benchmarks está vacía.

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Lo más interesante del lanzamiento de Microsoft de esta semana no es lo que Microsoft-Decision-1puede hacer. Es lo que Microsoft eligió no publicar sobre él. El modelo ya está disponible: se lanzó de forma general en Microsoft Foundry el 8 de octubre de 2026, dos días antes de que se escribiera esto. Es un modelo de puntuación de decisiones: le das un estado y una pregunta con un conjunto fijo de respuestas, y devuelve una puntuación calibrada por respuesta —entrenado posteriormente por Microsoft sobre el modelo de pesos abiertos Qwen3.5-9B, ejecutando una pasada sobre hasta 32.768 tokens y emitiendo cero tokens de salida porque no genera absolutamente nada. La página del modelo tiene una pestaña Benchmarks. Contiene un párrafo de metodología y ninguna cifra.

Esa laguna es la historia, y es más útil que otro titular de «Microsoft lanza un modelo». Toda pregunta seria sobre un scorer es una pregunta de calibración —¿un 0,8 devuelto significa 0,8?—, y un lanzamiento que llega sin una sola puntuación de Brier ni una cifra de error de calibración esperado deja que el único número que importa lo tenga que medir quien lo adopte. Lo que sigue es lo que la página de Foundry documenta realmente, lo que omite de forma llamativa y lo que un equipo de evaluación puede hacer al respecto esta semana.

Qué se lanzó, exactamente

Microsoft-Decision-1 es una API alojada. El contrato es una llamada de entrada, una distribución de salida, sin ningún bucle de decodificación en ninguna parte del recorrido: la solicitud lleva el material que se va a evaluar más una pregunta con un conjunto acotado de respuestas, y la respuesta lleva una probabilidad para cada opción. Microsoft enumera las formas de pregunta admitidas como sí/no, opción múltiple, valoración, clasificación y basadas en rúbricas, todo dentro de una única invocación de hasta 32K tokens. Es solo texto —no admite entrada de imagen, audio ni vídeo, y a la salida no devuelve más que números.

Las exclusiones se indican con la misma claridad que las características, y vale la pena leerlas antes que nada: no está diseñado para la generación de texto, la respuesta a preguntas abiertas, la conversación, la traducción o el resumen, y no está pensado para tareas que requieran conocimiento ausente en la entrada. No produce justificaciones. Los casos de uso publicados son todos aquellos en los que un equipo de plataforma ya tiene una decisión etiquetada que tomar: calificar una respuesta generada según una rúbrica, juzgar la relevancia de la recuperación, clasificar una cola, controlar la llamada a una herramienta de agente propuesta, filtrar contenido según umbrales que define la aplicación en lugar de una política fija del proveedor, y aceptar automáticamente los resultados de alta confianza mientras se escalan los demás.

Dos detalles operativos destacan en el listado de implementación. El primero es que Microsoft admite explícitamente una opción de abstención como «no se puede determinar» cuando la evidencia proporcionada es insuficiente; esa es la diferencia entre un evaluador calibrado y uno que solo tiene confianza, y es lo que hace que el uso de umbrales funcione. El segundo es que la inferencia por lotes está deshabilitada. No puedes amortizar una gran ejecución de puntuación a través del canal por lotes como lo harías con un modelo generativo, así que la latencia por llamada es la latencia de tu canalización, no el problema de un trabajo sin conexión.

La distribución es exclusiva de Foundry, dentro de la cartera "Direct from Azure" como implementación sin servidor o de punto de conexión unificado en SKU estándar — pago por uso o rendimiento aprovisionado reservado. Los pesos no se distribuyen. No hay repositorio de Hugging Face, ni descarga, ni vía de ajuste fino, ni opción de autoalojamiento. Las aplicaciones se integran mediante HTTPS con autenticación estándar de Azure. La divulgación sobre el entrenamiento informa que el conjunto de datos se utilizó por primera vez en septiembre de 2026 y que su recopilación sigue en curso, lo que supone la distancia más corta posible entre los datos de entrenamiento y una fecha de disponibilidad general (GA), y es lo normal en un post-entrenamiento sobre una base ya publicada por otro.

La pestaña de puntos de referencia, citada en su totalidad

Esto es todo lo que Microsoft ha publicado sobre el rendimiento del modelo. La evaluación utilizó «benchmarks de decisiones públicos y comunitarios y conjuntos de prueba internos reservados que no se usaron en el entrenamiento». Las métricas fueron exactitud, error de calibración, recall de seguridad, tasas de falsos positivos y consistencia de equidad. Se varió el orden de las opciones. Se aplicaron pruebas estadísticas pareadas. La afirmación es cualitativa: Microsoft-Decision-1 «tiene un rendimiento a la par de los modelos de decisión líderes y por delante de otros modelos de decisión abiertos evaluados con la misma metodología».

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text states that it is a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, that it is built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, that it will also rebase on other models including MAI and OpenAI, and lists quick facts: publisher Microsoft, type Text classification and Zero shot classification, lifecycle Generally available (GA), context window 32768, and a Pricing field that links out rather than printing a rate.

Eso es un diseño de evaluación competente descrito sin un resultado. No es una acusación señalarlo —un párrafo de metodología sin tabla es una elección concreta y verificable, y es una elección distinta de la que ha hecho el resto de esta pequeña categoría. Los modelos abiertos de decisión con los que Microsoft se compara implícitamente publican sus cifras: la familia Intern-Decision de InternLM imprime cifras de Brier y de error de calibración esperado en sus tarjetas de modelo, el Jev de TypeSafe publica ambas, y la línea d1 de Liquid AI incluye tablas de precisión junto con sus pesos. Microsoft es la empresa más grande de este grupo y la única que pide que se confíe en ella.

La empresa sí dice dónde cree que el modelo es fuerte y débil, lo cual es más útil para actuar que una puntuación de titular. Más fuerte: razonamiento, aplicación de reglas y robustez frente al formato de los prompts. Competitivo: clasificación, recuperación, equidad, uso de herramientas y la mayoría de las tareas multilingües. Más débil: conocimiento especializado del dominio. Las limitaciones autodeclaradas son sinceras de la misma manera — las puntuaciones pueden variar según la formulación y el orden de las opciones, una pregunta mal formulada sigue devolviendo una puntuación, la calibración es más sólida en tipos de tareas familiares y no hay explicaciones que auditar cuando una respuesta parece incorrecta.

La cobertura de idiomas conlleva el mismo tipo de advertencia. 25 idiomas figuran como compatibles, y abarcan, entre otros, japonés, coreano, árabe, vietnamita, tailandés, turco, hindi, bengalí, suajili, hebreo, persa y ucraniano, con la advertencia explícita de que la cobertura, la calidad y la calibración "pueden variar según el idioma" y de que los idiomas distintos del inglés, en particular los de menos recursos, son un área de bajo rendimiento. La versión base Qwen3.5-9B admite bastante más de 200 idiomas. El postentrenamiento conservó aproximadamente una cuarta parte de eso, y esa cuarta parte es donde se ajustó la calibración.

A single-column generated scoreboard for Microsoft-Decision-1 with six rows: base model Qwen3.5-9B post-trained by Microsoft; availability Foundry GA, October 8, 2026; context 32,768 tokens; output calibrated probabilities with zero output tokens; published benchmarks a methodology only with no figures; weights hosted API only, not distributed. A footer line reads that all figures are Microsoft-reported with no independent reproduction and no published Brier or expected calibration error.

Tampoco hay precio en la página

El campo de precios del catálogo no indica ninguna tarifa. Enlaza con la propia superficie de precios de modelos de Microsoft, así que el coste por decisión es algo que se consulta en Azure o en una factura, no en la ficha del modelo. Para quien modela el coste por decisión a escala, eso es una laguna real, y conviene decirlo con claridad en lugar de estimarlo. Dos cosas sí se derivan de la arquitectura y conviene incorporarlas a esa estimación: el 0 % del coste de una llamada son tokens de salida, porque no hay ninguno, y el conjunto de opciones forma parte de la entrada, así que una pregunta con sesenta y dos opciones descriptivas cuesta más por llamada que una de sí/no: estás pagando por la rúbrica que escribiste, no por la respuesta.

Por qué esta forma de lanzamiento es la parte interesante

Un puntuador de decisiones es una apuesta a que lo que las empresas primitivas realmente necesitan no es un mejor redactor, sino un juez más barato y fiable. Esa apuesta solo rinde si la probabilidad es digna de confianza, porque todo lo que está aguas abajo de un puntuador es un umbral: 0,7 escala a una persona, 0,95 se autoacepta, y el coste de equivocarse en esa línea se paga en malas decisiones automatizadas en lugar de en tokens. Un proveedor que entrega el puntuador sin la tabla de calibración les está pidiendo a cada cliente que la vuelva a derivar con sus propios datos.

La propia documentación de Microsoft recomienda exactamente eso, lo que suaviza la crítica y agudiza la conclusión práctica al mismo tiempo. Valida con datos representativos de tu caso de uso. Establece los umbrales a partir del costo de tus errores, no de un valor predeterminado. Incluye siempre una opción de abstención. Aleatoriza el orden de las opciones cuando este pueda sesgar la respuesta. Mantén a una persona en el circuito para todo lo que tenga consecuencias. Es un consejo sólido para cualquier evaluador. Es el único consejo disponible para este.

Probándolo esta semana sin comprometerme

La evaluación más barata consiste en elegir una decisión que ya tomas a mano, reunir doscientos casos etiquetados con los conjuntos de respuestas que tu aplicación realmente proporcionaría, y pasarlos por un despliegue de Foundry. Calcula el error de calibración esperado en la salida y sabrás más sobre Microsoft-Decision-1 que cualquier cosa que Microsoft haya publicado al respecto, porque lo habrás medido en tu distribución en lugar de en un conjunto de pruebas interno reservado. Eso es una tarde de trabajo y retira por completo la cuestión del benchmark.

Donde encaja OrcaRouter es en la otra mitad de un bucle de puntuación, y es la mitad que genera. No alojamos Microsoft-Decision-1 y no está en nuestro catálogo — un modelo que devuelve probabilidades en lugar de texto no es algo a lo que se enruten completaciones de chat, y nada de esto debería interpretarse como una afirmación de disponibilidad. Lo que hay detrás de nuestra única clave compatible con OpenAI es el conjunto de más de 200 modelos que se encarga de escribir: el modelo que redacta la rúbrica, los dos que producen respuestas candidatas, el que emite la llamada a herramienta Decision-1 y luego puntúa antes de que se ejecute. El precio de lista del proveedor se transfiere con 0 % de margen, así que una rebaja de precio en el lado del generador se aplica en el nuestro el mismo día, y la conmutación por error automática mantiene vivo el tramo de generación cuando un único proveedor se degrada — lo cual importa más en una canalización que puntúa todo lo que ve que en una que responde a un usuario de forma ocasional. Si prefieres no elegir un único juez, el DSL de enrutamiento compone varios modelos en una sola llamada, y la fusión de modelos informa su acuerdo como un campo puntuado en lugar de como prosa que tienes que leer.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

Lo que cambiaría este artículo es una tabla. Publiquen las puntuaciones de Brier y el ECE, o dejen que una ejecución independiente llegue a una tabla de clasificación, y la evaluación anterior pasa a ser una confirmación en lugar de la única prueba existente. Hasta entonces, la descripción precisa de Microsoft-Decision-1 es limitada: los pesos son reales, el contrato está documentado mejor de lo que consiguen la mayoría de las versiones alojadas, la opción de abstención está integrada por diseño en lugar de añadida a posteriori, y la afirmación de rendimiento es una frase —una bien escrita, que no va acompañada de ningún número.

En resumen

Microsoft-Decision-1 alcanzó la disponibilidad general en Microsoft Foundry el 8 de octubre de 2026 como un evaluador de decisiones de solo texto y 32,768 tokens, basado en Qwen3.5-9B, que devuelve probabilidades calibradas sobre tus propios conjuntos de opciones con cero tokens de salida y sin pesos que descargar. Sus fortalezas son un contrato limpio de una sola pasada, una ruta de abstención incorporada por diseño, y autenticación, facturación y gobernanza de Azure adjuntas; su debilidad es que nadie fuera de Microsoft tiene una cifra publicada sobre qué tan bien calibrado está, incluido Microsoft. Trata el lanzamiento como una API que pasa a estar disponible, no como una capacidad que queda establecida, y pon a prueba tus propios casos etiquetados con él antes de que algo posterior dependa de un umbral.