Una tarjeta de título generada para Microsoft-Decision-1 vs Laya con el subtítulo «cobertura de idiomas frente a longitud de contexto», con etiquetas que indican 25 idiomas compatibles frente a más de 100 idiomas, un contexto de 32.768 tokens frente a una ventana de 1.024 tokens, solo API alojada frente a pesos Apache-2.0, y un pie de página que señala que las cifras de ambos proveedores son autodeclaradas.
Engineering & Research

Microsoft-Decision-1 vs Laya: 25 idiomas detrás de una API, más de 100 detrás de una descarga de 322 MB

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Si se cuentan los idiomas, la comparación parece decidida. Microsoft-Decision-1, disponible de forma general en Microsoft Foundry desde el 8 de octubre de 2026, enumera 25 idiomas compatibles y afirma sin rodeos que la cobertura, la calidad y la calibración "pueden variar según el idioma", y señala a los idiomas distintos del inglés y, en especial, a los de bajos recursos como un área de bajo rendimiento. Laya, publicado por Convai Innovations el 18 de septiembre de 2026 bajo Apache 2.0, se describe como multilingüe en más de 100 idiomas e informa de que 45 de los 51 idiomas probados siguen siendo utilizables con enrutamiento, frente a 23 de 51 en el caso de su hermano exclusivo para inglés. Uno es un modelo de 9B detrás de un endpoint de Azure con un contexto de 32.768 tokens; el otro es un clasificador de 421 millones de parámetros que funciona a 32,8 milisegundos por decisión en una sola Tesla T4, gratis. Ambos se niegan a escribir un token y ambos devuelven probabilidades sobre las opciones que tú definas.

Pero lee las dos tarjetas de modelo completas y el recuento de idiomas deja de ser la cifra interesante. Es la historia de calibración que hay detrás, y los dos proyectos cuentan esa historia en direcciones opuestas.

Laya publica la cifra que incomoda a su propio marketing

La tarjeta de modelo de Laya declara, en su propia sección de limitaciones, que los checkpoints base obtienen 0.362 zero-shot en el benchmark de decisiones tipadas — por debajo de la línea base de clase mayoritaria de 0.461. Es decir, una tarjeta que te dice que su modelo es peor que adivinar «la respuesta más común» en esa prueba. También declara que los checkpoints base están cerca del azar en zero-shot, que la cifra destacada de 0.766 en decisiones tipadas requiere fine-tuning sobre el propio split de ese benchmark, que las preguntas ordinales de puntuación son la primitiva más débil (SST-5 0.372), que las preguntas de elección de alta cardinalidad se ven perjudicadas porque 77 opciones dejan apenas tres o cuatro tokens para cada una, que noul puede seguir sus propias etiquetas, y que el campo action.act_probability «todavía no aporta ninguna señal utilizable», con un AUROC de 0.30. La propia frase de resumen de Convai es la que hay que trasladar a cualquier evaluación: Laya es una base rápida que especializar, no un motor de decisiones zero-shot.

Esa franqueza es más valiosa de lo que parece, porque te dice exactamente para qué sirve Laya. Es un codificador que ajustas con tus propias etiquetas: toda la arquitectura está construida para que los nuevos esquemas no necesiten reentrenamiento, pero para rendir bien en una tarea sí. Usado así, las cifras publicadas son sólidas: 0.766 frente a 0.727 de Jev en decisiones tipadas tras el ajuste fino, AG News 0.950 frente a 0.910, DAIR Emotion 0.595 frente a 0.480, y ECE 0.081 frente al 0.246 de Jev, con la nota honesta de que llega con exceso de confianza y necesita un reajuste de temperatura, que desplaza el ECE medio de 0.466 a 0.081.

Microsoft publica la metodología pero oculta el resultado

La página de Foundry de Microsoft-Decision-1 realiza el mismo ejercicio en la dirección opuesta. Describe la evaluación en detalle —benchmarks de decisiones públicos y de la comunidad, además de conjuntos internos reservados; métricas como exactitud y error de calibración; orden de las opciones variado; pruebas estadísticas pareadas; arnés idéntico para los modelos comparados— e informa que el modelo «rinde a la par de los modelos de decisión líderes y por delante de otros modelos de decisión abiertos evaluados con la misma metodología». Nombra sus áreas fuertes (razonamiento, aplicación de reglas, robustez ante el formato de los prompts) y sus débiles (conocimiento especializado de dominio, idiomas distintos del inglés).

Y luego no imprime nada. Ninguna cifra de precisión, ningún error de calibración, ninguna tabla por benchmark. Las limitaciones autoinformadas son reales y útiles —las puntuaciones cambian con la formulación y el orden de las opciones, una pregunta mal planteada igual devuelve una puntuación, la calibración es más sólida en tipos de tareas familiares, no se producen explicaciones—, pero una lista de limitaciones no es una medición. Así que el intercambio es inusualmente claro: Laya te da números que puedes intentar falsar con tus propios datos, y Microsoft te da una postura de cumplimiento y un contexto de 32K en el que puedes introducir un documento largo.

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

Lo que realmente aporta la diferencia de tamaño

La pequeñez de Laya no es una concesión aquí, es el diseño. Porque cada opción se puntúa en su propio token [MASK] y se aplica softmax sobre las opciones de esa pregunta, el espacio de respuestas se ensambla en el momento de la solicitud en lugar de estar integrado en una cabeza de vocabulario — por eso un esquema que inventes esta tarde no necesita reentrenamiento, y por eso el modelo cabe en 322 a 421 millones de parámetros. El checkpoint multilingüe se ejecuta aproximadamente 2,2 veces más rápido que el inglés, el enrutador detecta el script en menos de medio milisegundo, y el rendimiento por lotes alcanza de 103 a 332 preguntas por segundo en una T4. Para una carga de trabajo que puntúa cada ticket, cada documento recuperado o cada acción propuesta, ese rendimiento es la característica, no el número de parámetros.

Los costes de ese diseño son igualmente específicos y merece la pena señalarlos frente a la alternativa de Microsoft. El checkpoint en inglés toma una ventana de 512 tokens; el multilingüe, 1.024, ampliable hasta 8K. Microsoft-Decision-1 toma 32.768. Un hilo de soporte largo, un contrato completo o un documento de políticas de varias páginas no caben en absoluto en la ventana de Laya, y ninguna cantidad de velocidad compensa el truncamiento. Laya responde a un conjunto de preguntas por pasada forward con un presupuesto de tokens documentado por opción; Microsoft documenta una única invocación de hasta 32K tokens sin un límite por pregunta. Y el punto débil competitivo de Laya como clasificador merece la pena conocerlo: obtiene 0,425 en Banking77 frente al 0,870 de Jev, que es el tipo de problema de intención de grano fino y alta cardinalidad donde más importa una pasada de especialización.

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

La comparación de costos que no es por token

Laya es gratis en el punto de uso —autoalojado, Apache 2.0, con un costo de autoalojamiento listado de "$0"— y su precio real es la ejecución de ajuste fino que le debes antes de que sea bueno en tu tarea. Microsoft-Decision-1 es una API de Foundry alojada con una tarifa por token que no está impresa en la página del modelo, sin pesos para descargar, sin ruta de ajuste fino y con inferencia por lotes deshabilitada. Uno es un proyecto inicial de etiquetado de datos, el otro es una llamada medida. Cuál es más barato depende enteramente del volumen, y el punto de equilibrio es alto: un codificador de 421M que puntúa 300 elementos por segundo en una T4 alquilada es muy difícil de superar por decisión una vez que ha sido entrenado.

Aquí es donde OrcaRouter se gana su lugar en un pipeline construido sobre cualquiera de los dos modelos, y es únicamente el lado generativo. No alojamos ni Microsoft-Decision-1 ni Laya: ambos devuelven probabilidades en lugar de texto, ninguno está en nuestro catálogo, y un endpoint de scoring no es un destino de chat-completions. Lo que sí ofrecemos es el modelo que produce aquello que se puntúa: la respuesta en borrador, la llamada a herramienta propuesta, la respuesta candidata que luego juzga la cabeza fine-tuned de Laya. Son más de 200 modelos detrás de una única clave compatible con OpenAI al precio de lista del proveedor, transferido con un 0 % de margen, con failover automático cuando una ruta de servicio se degrada. En un bucle que puntúa todo lo que genera, la llamada de generación es la parte que puede caerse, y el failover es lo que mantiene alimentada la cola de scoring.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

¿Cuál elegir?

Elige Laya si tus decisiones llegan en muchos idiomas, si tu volumen es lo bastante alto como para que el precio por token sea relevante, si tienes etiquetas y una semana para hacer ajuste fino, o si necesitas ejecutar la puntuación en hardware dentro de tu propio perímetro. Acepta la ventana de 512 a 1024 tokens y el hecho de que el checkpoint base tendrá un rendimiento cercano al azar hasta que lo especialices, y obtienes un modelo de decisión que asume con honestidad que es un punto de partida.

Elige Microsoft-Decision-1 si tus entradas son documentos largos en lugar de tickets, si tu puerta de despliegue es la autenticación de Azure, la facturación unificada y un paquete de IA responsable en lugar de una descarga, si 25 idiomas cubren tu tráfico, o si prefieres no ser dueño del modelo en absoluto. Acepta que tendrás que trazar tú mismo su primera curva de calibración y reserva una tarde en una muestra etiquetada para hacerlo, porque, a diferencia de Laya, esta no te entregará un número ECE con el que discutir.