Una tarjeta de título generada para la comparación entre Laya y Decider, que lleva el propio subtítulo de este artículo y una línea de pie de página que indica qué cifras son reportadas por el proveedor y cuáles son de terceros.
Engineering & Research

Laya vs Decider: Un codificador de 421M contra una mezcla de 35B

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Laya y Decider son dos modelos de decisión de pesos abiertos y no autorregresivos que responden preguntas tipadas —una elección de una lista proporcionada, una puntuación en una rúbrica ordenada, una probabilidad sí/no— en un solo pase hacia adelante, y se ubican en extremos opuestos del espectro de tamaño. Convai Innovations publicó Laya el 18 de septiembre de 2026 bajo Apache 2.0: un codificador ModernBERT-large de 421M para inglés con una ventana de 512 tokens, un checkpoint multilingüe mmBERT-base de 322M con una ventana de 1.024 tokens que cubre más de 100 idiomas, y un enrutador que detecta el sistema de escritura y lo dirige al correcto. La familia Decider de Mapika abarca desde decider-0.8b y decider-2b sobre bases generativas pequeñas hasta decider-35b-a3b, un mixture-of-experts de 35B con aproximadamente 3B parámetros activos. Ambos son gratuitos para descargar y ambos devuelven probabilidades en lugar de texto. La razón por la que no son intercambiables no es la cifra de precisión que encabeza la mayoría de los análisis.

Dos familias, una apuesta arquitectónica

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

La apuesta compartida es que una decisión no necesita un bucle de decodificación. Un modelo generativo al que se le pregunta «¿es este ticket una solicitud de reembolso?» tiene que emitir tokens, y en el momento en que emite tokens, tú te encargas del parseo, la validación de esquemas y una ruta de reintento para la vez de cada doscientas que olvida una llave. Tanto Laya como Decider se saltan eso al leer la respuesta directamente de una única pasada hacia adelante: Laya de un codificador bidireccional, Decider de los logits de tokens de opciones con letras en una ranura de respuesta dedicada en el prompt.

Ahí es donde termina el parecido. Laya consta de dos pequeños codificadores detrás de un enrutador de lenguaje, lo que le proporciona una ventana de 512 tokens en inglés y una multilingüe de 1024 tokens con un recuento de parámetros de 421M y 322M. Decider conserva una red troncal generativa y añade una capa de lectura por encima: decider-2b es un ajuste fino supervisado de Qwen3.5-2B-Base seguido de una pasada de refuerzo con conciencia de calibración en tareas de navegador en vivo y juegos exactos, mientras que decider-35b-a3b congela los expertos enrutados y entrena matrices de bloques con Muon. La consecuencia práctica es que Decider hereda el conocimiento del mundo de un modelo de lenguaje y Laya no. La otra consecuencia es que Decider hereda la huella de un modelo de lenguaje.

A screenshot of the decider-2b model card on Hugging Face, showing the Qwen3.5-2B base, the text-classification pipeline tag, the English-language tag, and the decision-model and calibrated tags for the Mapika Decider family.

La propia documentación de Mapika sitúa a decider-2b en 18 ms de mediana por decisión en una B300 en bf16, con lote de uno, sin gráficos de CUDA ni compilación, y a decider-35b-a3b en 41 ms con la misma configuración. En una GH200 con contextos de tickets de soporte de aproximadamente 230 tokens y entre tres y cinco preguntas escritas, el mismo proyecto reporta 49 ms en modo eager, 4,0 ms con gráficos de CUDA y torch.compile, y unas 1.370 decisiones por segundo con lote de 32. Esas son cifras publicadas por el proveedor en el propio informe del proyecto, no una medición independiente. La cifra destacada de Laya también está publicada por el proveedor: 32,8 ms de p50 por decisión en una Tesla T4, y 7,2 ms por pregunta con un tamaño de lote de 10.

La cuestión de la calibración, que los dos proyectos responden a escalas diferentes

La calibración es el número que más importa para un modelo de decisión, porque el objetivo mismo de devolver una probabilidad es que alguien, más adelante en el proceso, establezca un umbral sobre ella. Aquí es también donde comparar Laya y Decider directamente te llevará a engaño.

Laya se distribuye con un error de calibración esperado de 0.466 en su propia ficha de modelo, y la ficha indica claramente que reajustar una temperatura por tipo de pregunta lo lleva a 0.081. Es una divulgación inusualmente honesta, y también significa que el checkpoint distribuido no es el artefacto calibrado. El número que obtienes de fábrica es 0.466.

Decider reporta sobre un instrumento completamente distinto. El Decision Index —una tabla de clasificación abierta que ejecutó todas las reproducciones abiertas de Jev a lo largo de 132.422 solicitudes— sitúa a decider-35b-a3b en cuarto lugar general con 54,3, por detrás del 59,5 de Jev, y lo reporta como el mejor calibrado de las 32 entradas, con un error de calibración de 3,1 puntos y un 0,4% de respuestas incorrectas con una confianza declarada del 95% o superior. decider-2b reporta 8,8 puntos y un 0,9%. Esas son cifras publicadas en la tabla de clasificación, y 3,1 puntos en el ECE de diez intervalos del Index no es la misma medición que el 0,466 de Laya en su propia evaluación. Ponerlas una al lado de la otra en una tabla sería un error de comparar peras con manzanas disfrazado de rigor. Lo que sí se puede decir es que el autor de Decider eligió que lo midieran en una tabla de clasificación de terceros y el autor de Laya eligió publicar él mismo su cifra de calibración más débil; ninguno ha sido auditado por el arnés del otro.

Dónde gana cada uno, dimensión por dimensión

• Backbone — Laya: codificador ModernBERT-large de 421M, bidireccional. Decisor: bases generativas Qwen3.5, de 0,8B a 35B-A3B.

• Idiomas — Laya: más de 100 mediante un checkpoint multilingüe de 322M detrás de un enrutador. Decider: solo inglés, declarado como una limitación.

• Ventana de contexto — Laya: 512 tokens en inglés, 1,024 multilingüe. Decider: entradas de hasta 32k aceptadas, entrenado hasta 16k en la generación v6, probado hasta 30k.

• Techo del conjunto de opciones — Laya: se degrada drásticamente más allá de aproximadamente 20 opciones, 0,425 en Banking77 frente al 0,870 de Jev. Decider: Choice sobre 2 a 255 opciones con nombre, Score sobre 2 a 10 niveles descritos.

• Precisión en zero-shot — Laya: 0.362 en el benchmark de decisiones tipadas, por debajo de la línea base de clase mayoritaria de 0.461. Decider: no se publica como una cifra de zero-shot; en su lugar, el proyecto informa resultados específicos de cada tarea.

• Calibración — Laya: ECE 0,466 tal como se distribuye, 0,081 tras el reajuste de temperatura por tipo de pregunta. Decider: 3,1 puntos en el Decision Index para el 35B, la mejor de 32 entradas.

• Razonamiento — Laya: ninguno, por construcción. Decider: ninguno, indicado explícitamente — es una lectura de coincidencia de patrones, no un razonador.

• Licencia — Apache 2.0 para ambos.

Un detalle más de Decider que conviene conocer antes de elegirlo: el proyecto advierte que elegir un registro de un array JSON largo por su posición es un caso débil, y recomienda acceder a los registros por clave. Ese es el tipo de limitación que solo se aprende ejecutándolo.

Lo que te cuesta ejecutar cualquiera de los dos

El perfil de costos de Laya es un proyecto de ajuste fino. El modelo es lo suficientemente pequeño como para ejecutarse en la CPU de un portátil para trabajo de bajo rendimiento, pero la puntuación zero-shot del checkpoint en inglés que se distribuye se sitúa por debajo de la línea base trivial, lo que significa que adoptar Laya es adoptar la tarea de construir un conjunto etiquetado, hacer ajuste fino y reajustar la temperatura por tipo de pregunta. La recompensa es que, una vez hecho esto, el artefacto tiene 421M de parámetros y responde en decenas de milisegundos en una T4. El checkpoint laya-typed-decisions ajustado por Convai alcanza 0,766 en la división de entrenamiento del benchmark — una cifra que dice más sobre el ajuste fino que sobre el modelo base, y la ficha así lo indica.

El perfil de costos de Decider es una decisión de servicio. Estás eligiendo cuánta GPU alquilar, y la familia te da un verdadero control: 18ms en un 2B frente a 41ms en un 35B-A3B, con el modelo más grande aportando conocimiento y margen de razonamiento en GPQA, GSM8K, CRUXEval y MMLU que los pequeños no tienen. Si tu tarea es acotada y tus etiquetas son fijas, decider-2b es la máquina más barata. Si tu tarea necesita que el modelo sepa cosas, pagas por la mezcla.

Dónde encaja OrcaRouter — y dónde no

Ni Laya ni Decider son modelos alojados en OrcaRouter. Tú descargas los pesos y los ejecutas por tu cuenta, y nada de esto cambia eso. Lo que sí cambia es la otra mitad del patrón. Un modelo de decisión tipado casi nunca es toda la aplicación: algo tiene que leer el ticket, resumir el hilo o redactar la respuesta que la decisión condiciona. Esa mitad es una llamada generativa, y es la mitad para la que está hecho OrcaRouter — más de 200 modelos detrás de una sola clave compatible con OpenAI a precio de lista del proveedor transferido con 0% de margen, de modo que una rebaja de precios del proveedor llega a tu factura el mismo día en lugar de en la próxima renovación del contrato. Si estás ajustando un checkpoint de Laya con los resultados de un modelo de frontera, o enrutando entre decider-2b para el triaje y un modelo grande para el 4% difícil, mantener el lado generativo en un único endpoint significa que el lado de la decisión y el lado de la generación no necesitan dos contratos ni dos SDK. La conmutación automática por error cubre el caso en que el modelo grande es la parte que se cae.

¿Cuál elegir?

Elige Laya si tus entradas son multilingües, tus etiquetas son pocas, tu presupuesto de latencia es de decenas de milisegundos en hardware modesto y estás dispuesto a hacer ajuste fino —porque tendrás que hacerlo. Elige Decider si tus entradas son en inglés, necesitas que el modelo aporte cierto conocimiento del mundo a la decisión y prefieres elegir un tamaño de modelo en lugar de ejecutar un pipeline de entrenamiento. Si tus conjuntos de opciones superan las veinte etiquetas, lee la cifra de Banking77 de Laya antes de comprometerte; si tus entradas son documentos JSON largos que direccionas por posición, lee la limitación declarada de Decider antes de comprometerte.

La comparación que realmente resolvería esto —ambos modelos con entradas idénticas byte a byte, los mismos prompts, el mismo orden de opciones, el mismo barrido de umbrales— aún no existe. Hasta que exista, la postura honesta es que Laya tiene la mejor curva de costos y Decider tiene la mejor evidencia de calibración, y que ambos son lo suficientemente incipientes como para que la evaluación que construyas con tus propios datos valga más que los números publicados de cualquiera de los dos proyectos.

A generated two-column scoreboard comparing Laya and Decider across backbone, languages, context, zero-shot accuracy, calibration and serving, with a footer reading "Laya figures per its own model card; Decider per Mapika and the Decision Index."