Una tarjeta de título generada para la comparación Laya versus Kev, que lleva el subtítulo propio de este artículo y una línea al pie que indica de qué lado las cifras son reportadas por el proveedor y de cuál son de terceros.
Engineering & Research

Laya vs Kev: Dos recetas para un modelo de decisión local

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El número más útil en la comparación entre Laya y Kev es un recibo. Jared Palmer entrenó la familia Kev por unos $95 en tiempo de H100 en Modal, más unos tres centavos de llamadas a API para datos de evaluación, y publicó la receta junto con los pesos. Convai Innovations tomó la otra ruta con Laya: lanzada el 18 de septiembre de 2026, tres días después del Jev de TypeSafe AI, Apache 2.0, pesos en Hugging Face, un punto de entrada mediante pip install laya, y sin pipeline de entrenamiento — un checkpoint inglés de 421M ModernBERT-large, uno multilingüe de 322M mmBERT-base, y un enrutador que elige entre ellos. Kev es una familia de tres modelos pequeños de 0,8B, 4B y 9B, cada uno una base congelada más un adaptador LoRA de rango 16 y una pequeña cabeza de puntero. Ambos responden preguntas tipadas en una sola pasada hacia adelante y ninguno genera texto. La decisión entre ellos es en realidad una decisión sobre qué artefacto quieres poseer: un checkpoint o una receta.

Qué está entregando realmente cada proyecto

Laya incluye inferencia. El checkpoint en inglés es un codificador bidireccional con una ventana de 512 tokens; el multilingüe cubre más de 100 idiomas con una ventana de 1.024 tokens y se ejecuta aproximadamente al doble de velocidad; el enrutador detecta el sistema de escritura en menos de medio milisegundo. Responde a elección, puntuación y noul — una selección de una lista, un nivel esperado en una rúbrica ordenada y una probabilidad calibrada de que una afirmación sea verdadera. Hay un tercer checkpoint, laya-typed-decisions, que es el mismo backbone de 421M ajustado sobre la partición de entrenamiento del benchmark typed-decisions. La propia tarjeta de modelo de Convai contiene la frase que debería regir cómo interpretas cada número de Laya: "Laya es una base rápida para especializar, no un motor de decisiones zero-shot."

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Kev repository on GitHub, showing the description "tiny Jev-like family of decision models built on top of Qwen3.5 you can train and run on your own", the Apache-2.0 licence, and the Kev-0.8B, Kev-4B and Kev-9B releases.

Kev presenta un método. El repositorio documenta decision-v7: dos épocas sobre 10.000 ejemplos extraídos de diez conjuntos de datos públicos, 896 ejemplos de políticas generados y 1.680 ejemplos construidos a partir de 60 estructuras de reglas generadas. La cabeza puntúa cada opción proporcionada frente al decide token de la pregunta y aplica softmax al resultado. Como los checkpoints de Qwen3.5 mezclan atención con capas recurrentes Gated DeltaNet que ignoran las máscaras de atención, cada pregunta se ejecuta como su propia fila con el estado compartido calculado una vez y almacenado en caché — así es como el modelo mantiene las preguntas aisladas entre sí sin pagar por un prefill nuevo por pregunta. Kev replica el contrato público de TypeSafe /v1/systemone, por lo que un cliente existente del SDK de TypeSafe puede apuntar a un servidor Kev local cambiando la URL base. El README afirma que no se usaron salidas de Jev en el entrenamiento.

Los dos modos de fallo son diferentes, y esa es la verdadera historia

Ambos modelos pierden frente a Jev en las tareas que requieren conocimientos, pero pierden de maneras que exigen mitigaciones diferentes.

Las debilidades publicadas de Laya tienen que ver con la forma de la entrada. En el benchmark de decisiones tipadas de TypeSafe obtiene 0,362 en zero-shot, frente a 0,318 para la adivinación aleatoria y 0,461 para la línea base de clase mayoritaria: más cerca del azar que de la respuesta trivial. A partir de aproximadamente veinte opciones se desmorona: 0,425 en Banking77 frente al 0,870 de Jev. Es tan sensible al orden que una simple inversión del orden de las opciones redujo la precisión 13,75 puntos en una prueba de terceros, dejando una tasa de respuestas iguales del 42,5 %. Y los checkpoints distribuidos llegan con temperaturas inválidas: la biblioteca advierte al importar, lo que significa que la cifra de calibración de la ficha, un error de calibración esperado de 0,466, es el número que realmente obtienes antes de reajustar. Reajustar por tipo de pregunta lo lleva a 0,081, pero eso es trabajo que haces tú, no trabajo que haga la descarga. Hay un fallo multilingüe publicado que vale la pena leer en su totalidad: en escrituras no latinas, el checkpoint en inglés es catastróficamente sobreconfiado, con un ejemplo en jemer que muestra una precisión de 0,000 con una confianza promedio de 0,952.

Las debilidades publicadas de Kev son en materia de conocimiento y aritmética. Kev-9B obtiene 0.837 en su propia prueba bloqueada de nuevas fuentes —0.832 para el 4B y 0.668 para el 0.8B—, y alrededor de 0.822 fuera de dominio en la partición de desarrollo frente al 0.857 de Jev. La brecha se abre donde se requiere conocimiento del mundo: MMLU en torno al 70% frente al 90% de Jev, MMLU-Pro 0.515 frente a 0.840, y aritmética de fechas con precisión diaria 60% frente a 93%. En un conjunto estrecho de enrutamiento con etiquetas fijas gana —una evaluación de enrutamiento de tickets de soporte situó a Kev-9B en 0.952 frente al 0.897 de Jev—, pero el autor es explícito en que este es su propio arnés, que los datos de entrenamiento de Jev no se divulgan y que, por tanto, no puede construirse ninguna comparación controlada. Kev también mantiene un exceso de confianza con nuevas fuentes; establecer KEV_TEMPERATURE=2.0 redujo los errores con alta confianza del 8.7% al 4.4% en las propias pruebas del proyecto, lo que indica que la configuración predeterminada no es la segura.

La traducción práctica: el fallo de Laya lo desencadena tu conjunto de opciones y el formato de tu prompt, y lo solucionas con ajuste fino y reajuste. El fallo de Kev lo desencadenan las preguntas que necesitan datos, y lo solucionas acotando el modelo al enrutamiento y la clasificación y dejando las llamadas que dependen del conocimiento en otro lugar. Ninguna de las dos soluciones es un flag de configuración.

Lo que se necesita para servirles

• Hardware — Laya: codificadores de 421M/322M, viables en CPU para un rendimiento bajo y con menos de un gigabyte de memoria residente para el port de MLX en Apple silicon. Kev: de 0.8B a 9B, que necesita una GPU CUDA BF16 para el de 9B, con la arquitectura Qwen3.5 que requiere flash-linear-attention en CUDA y ROCm.

• Latencia — Laya: 32,8 ms p50 por decisión en una Tesla T4, 7,2 ms por pregunta con batch 10. Kev: unos 300 ms para cinco preguntas escritas de un modelo 4B en un Mac de 32 GB en bf16, aproximadamente 40 ms en una H100.

• Límites — Laya: ventana de 512 tokens en inglés, 1.024 en multilingüe. Kev: elección entre 1 y 255 opciones, puntuación de 2 a 255 niveles, 384 tokens de estado de entrenamiento con 8.192 en servicio.

• Servidor — Laya: Python en el mismo proceso, además de portes comunitarios a ONNX, Go y Apple MLX. Kev: un servidor local vinculado a 127.0.0.1 sin autenticación, un SDK de npm y adaptadores para LangChain y LlamaIndex.

• Licencia — Apache 2.0 para ambos.

Dos notas operativas que no aparecen en las cifras destacadas. El servidor de Kev es de solicitud única y sin autenticación por diseño: es un sidecar local, no algo que se exponga. Y la latencia del Mac de Kev es considerablemente peor que su latencia en H100 porque los kernels rápidos de DeltaNet aún no existen para MLX, que es exactamente el tipo de detalle que convierte una afirmación de "se ejecuta localmente" en una de "se ejecuta localmente en el hardware correcto".

La mitad generativa del patrón

Ambos modelos existen para reemplazar una llamada específica: la invocación del LLM que estabas haciendo únicamente para obtener una etiqueta o una probabilidad de vuelta. No reemplazan las llamadas en las que realmente necesitas prosa. Un sistema de soporte que utiliza Kev-9B para enrutar un ticket todavía necesita un modelo para resumir el hilo y redactar la respuesta, y ese modelo no va a ser un LoRA de 9B con una cabeza de puntero.

Esa es la costura en la que se sitúa OrcaRouter, más que una afirmación sobre alojar a cualquiera de estos. Ni Laya ni Kev están en nuestra lista de modelos —son pesos que descargas—, y el artículo sería engañoso si diera a entender lo contrario. Lo que sí está en la lista son los más de 200 modelos generativos detrás de una única clave compatible con OpenAI a precio de lista del proveedor trasladado con un 0 % de recargo. Si usas Kev para decidir a cuál de los tres niveles de resumen pertenece una solicitud, o usas Laya para puntuar si una respuesta preliminar es aceptable, el lado generativo de ambos bucles es un único endpoint con conmutación por error automática en lugar de un segundo contrato y un segundo SDK. El DSL de enrutamiento es la pieza que encaja de forma más natural en una arquitectura de modelo de decisión: combina un modelo barato y uno caro en una sola llamada y deja que la salida del modelo de decisión elija la rama.

Qué ver a continuación

La brecha en la evidencia es la misma para ambos, y no la va a cerrar ninguno de los dos proyectos. Nadie ha ejecutado Laya y Kev con entradas idénticas byte a byte, con los mismos prompts, el mismo orden de opciones y el mismo barrido de umbrales de confianza. Las victorias más destacadas de Laya provienen de su propio sistema de evaluación; las afirmaciones de casi paridad de Kev provienen del sistema de evaluación de su autor; la auditoría de calibración que encontró que la calibración de Jev variaba drásticamente según la tarea —44,7 % de precisión y 0,325 de error de calibración esperado en una tarea de priorización con política oculta— fue de un tercero, y ni Laya ni Kev han recibido ese tratamiento. Hasta que alguien lo haga, las cifras anteriores son las mejores disponibles y no son comparables entre sí.

Si estás decidiendo hoy: elige Kev si quieres un modelo de enrutamiento funcional esta semana en una GPU que ya alquilas, y acepta que habrá cosas que no sepa. Elige Laya si tus entradas son multilingües o tu presupuesto de hardware es un portátil, y presupuesta el ajuste fino como parte del proyecto en lugar de como una optimización posterior. En cualquier caso, mide con tus propios datos etiquetados antes de poner un umbral de confianza delante del tráfico de producción; ambos proyectos, en su propia documentación, te lo indican.

A generated two-column scoreboard comparing Laya and Kev across backbone, context window, latency, benchmark accuracy, many-option performance and licence, with a footer reading "Kev figures are the author's own harness; Laya figures per its model card."