Una tarjeta de título generada para la comparación Laya-versus-von, que lleva el propio subtítulo de este artículo y una línea de pie de página que indica qué cifras de cada parte son reportadas por el proveedor y cuáles son de terceros.
Engineering & Research

Laya vs von: Cuando el benchmark de proveedores no se transfiere

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Una tarea de clasificación de tipo de commit con seis etiquetas posibles, en la que adivinar te da un 8,3 % y von obtiene un 26,7 %. Una tarea de enrutamiento de archivos en la que el mismo modelo obtiene un 8,8 %, apenas por encima del azar. Una tarea binaria de amplitud de cambios con un AUC de 0,513, que es como lanzar una moneda al aire. Esos números provienen de una evaluación de terceros de von —el modelo System One de código abierto de wfzyx, un codificador ModernBERT-Large de 395 M publicado bajo Apache 2.0 el 18 de septiembre de 2026, el mismo día que Laya, de Convai Innovations—. En el propio benchmark jabr v2 de von, el panorama es el contrario: 71,5 % de precisión macro en 49 tareas y 869 casos, enrutamiento de elección con un 83,4 %, y un resultado en ViZDoom de 9,38 bajas promedio en menos de 18 ms frente a Jev, de TypeSafe AI, con 5,62 bajas y aproximadamente 115 ms. Ambos conjuntos de números son reales. La distancia entre ellos es lo más útil que alguien ha publicado sobre esta categoría de modelos, y también se aplica a Laya.

Dos modelos, dos backbones, un modo de fallo compartido

von y Laya son vecinos cercanos en términos arquitectónicos, y por eso el problema de transferencia es la perspectiva adecuada para compararlos. Ambos son codificadores no autorregresivos construidos sobre ModernBERT: von con 395 M de parámetros, y el checkpoint en inglés de Laya con 421 M. Ambos exponen las mismas tres primitivas — choice a partir de una lista proporcionada, score sobre una rúbrica ordenada, noul como probabilidad calibrada de sí — y ambos implementan el formato de cable /v1/systemone para que un cliente escrito para Jev de TypeSafe pueda apuntar en su lugar a un servidor local. Ambos son Apache 2.0. Ambos devuelven probabilidades en lugar de texto, y ninguno tiene un bucle de decodificación en el que alucinar.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

Las diferencias están en la historia de entrenamiento. von fue preentrenado con 2 billones de tokens de texto web general, literatura técnica y código, y luego ajustado finamente con un corpus equilibrado multidominio de aproximadamente 290.000 ejemplos que abarca flujos de trabajo operativos y empresariales, seguridad y DevOps, moderación de seguridad y políticas, lingüística, triaje y razonamiento adversarial. El entrenamiento posterior utilizó Aprendizaje por Refuerzo con Distribución de Calibración, minimizando un compuesto de entropía cruzada y puntuación de Brier con lambda en 0,5, y el escalado de temperatura convergió en T=1,1692. El checkpoint en inglés de Laya es ModernBERT-large ajustado finamente para la forma de decisión tipada, con una ventana de 512 tokens, junto con un checkpoint multilingüe mmBERT-base de 322M que cubre más de 100 idiomas detrás de un enrutador, y un p50 publicado de 32,8 ms por decisión en una Tesla T4.

El modo de fallo compartido es que ambos son codificadores entrenados para producir una lectura, no razonadores. El propio README de von es explícito en que está dirigido a pipelines sensibles a la latencia, donde los modelos autorregresivos introducen entre 500 y 2.000 ms de retraso y errores no deterministas de parseo de esquemas. Ese planteamiento te dice para qué sirve: clasificación rápida, determinista y calibrada estadísticamente. No te dice que vaya a funcionar en tu clasificación, y el benchmark independiente es lo que ocurre cuando alguien lo comprueba.

Leyendo con honestidad el propio benchmark de von

Los resultados de jabr v2 están publicados por su propietario y no han sido auditados de forma independiente, y la forma del benchmark importa tanto como la puntuación. Cuarenta y nueve tareas y 869 casos son una amplitud razonable para una evaluación de modelo de decisión, y 71,5 % de precisión macro es una cifra sólida para un codificador de 395M. El desglose por dominio es donde se vuelve informativo: triaje de síntomas con 100,0 %, servicios para el hogar con 95,7 %, enrutamiento urbano con 94,7 %, enrutamiento de opciones en general con 83,4 %. Esas son las tareas en torno a las cuales se construyó el corpus de entrenamiento: el README describe los datos de ajuste fino como flujos de trabajo operativos y empresariales, seguridad y DevOps, moderación de seguridad y políticas, lingüística, triaje y razonamiento adversarial. Una puntuación alta en triaje de síntomas es una declaración de que el modelo aprendió el dominio del triaje, no de que aprendió a clasificar.

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

El resultado de ViZDoom es el que más se cita, y merece una lectura cuidadosa. 9,38 bajas promedio en «Defend the Center», ocho semillas, zero-shot a partir de texto de escena estructurado, con una latencia inferior a 18 ms, frente a las 5,62 bajas de Jev a alrededor de 115 ms: una mejora del +66,9 %. Es un resultado llamativo y también es un entorno de juego impulsado por texto estructurado donde una política reflexiva rápida tiene exactamente la forma adecuada. El planteamiento del proyecto del paradigma del Sistema Uno —reflexivo, paralelo, determinista, estadísticamente calibrado— es una descripción justa de lo que esa tarea recompensa.

Luego, la evaluación de terceros puso a prueba a von en clasificación de tipos de commit, enrutamiento de archivos, detección de características y puntuación de amplitud de cambios, y perdió frente a las líneas base de palabras clave y regex en algunas de ellas. Un AUC de 0.513 en la tarea binaria es la cifra más reveladora: una moneda al aire, de un modelo cuya calibración se ajustó a T=1.1692 y cuyo README afirma un error de calibración esperado casi ideal. Ambas cosas pueden ser ciertas. Un modelo puede estar bien calibrado en la distribución con la que se entrenó y ser inútil en una distribución que nunca ha visto —y, de hecho, una buena calibración en la distribución equivocada es peor que una calibración obviamente mala, porque los números de confianza parecen fiables.

La misma prueba aplicada a Laya

Laya ha recibido una versión de este tratamiento, y los resultados son consistentes con los de von. En el benchmark typed-decisions de TypeSafe, Laya obtiene 0,362 en zero-shot frente a 0,318 de una base aleatoria y 0,461 de la de clase mayoritaria —más cerca del azar que de la respuesta trivial—. Su propia ficha de modelo afirma la conclusión: "Laya es una base rápida para especializar, no un motor de decisiones zero-shot". Más allá de unas veinte opciones, se degrada bruscamente, con 0,425 en Banking77 frente a 0,870 de Jev. En 100 mensajes de urgencia de Mars-base en una prueba de terceros, Jev obtuvo 100/100 y Laya 53/100. En un benchmark de agentes de navegador, completó 0 de 50 tareas, declarando la finalización prematuramente en 33 intentos, 17 de ellos antes de tomar ninguna acción —aunque los autores del benchmark señalan que fue entrenado para trabajo de juicio como tickets de soporte y facturas, no para navegación, lo que es una declaración de alcance más que un veredicto.

En lo que Laya se diferencia de von es en lo que afirma para sí. Convai publicó en la tarjeta la cifra zero-shot poco halagadora y el error de calibración esperado de 0,466, junto al 0,081 que produce el reajuste de temperatura por tipo de pregunta. El README de von publica la cifra halagadora de jabr v2 y la victoria en ViZDoom. Ambos proyectos son honestos respecto a lo que hicieron; solo uno de ellos encabeza con un benchmark en el que el modelo rinde mal. Eso es una observación sobre las fuentes, no una acusación — pero si vas a elegir entre los dos basándote en la evidencia publicada, ten en cuenta que estás comparando un proyecto que te mostró su cifra débil con otro cuya cifra débil tuviste que buscar en otro sitio.

El contraste de especificaciones, dimensión por dimensión

• Backbone — Laya: ModernBERT-large 421M inglés, mmBERT-base 322M multilingüe. De: ModernBERT-Large 395M.

• Idiomas — Laya: más de 100 mediante el checkpoint multilingüe y un enrutador. von: inglés, sin ningún checkpoint multilingüe publicado.

• Ventana de contexto — Laya: 512 tokens en inglés, 1.024 multilingüe. von: no se publica en los mismos términos; los casos de jabr v2 son decisiones estructuradas breves.

• Latencia — Laya: 32,8 ms p50 en una T4, 7,2 ms por pregunta en lote de 10. von: de menos de 15 ms a menos de 25 ms según lo declarado, menos de 18 ms en la ejecución de ViZDoom.

• Precisión reportada — Laya: 0,362 en zero-shot, 0,766 con ajuste fino en la propia partición del benchmark, 0,425 en Banking77. von: 71,5 % macro en las 49 tareas de jabr v2, 83,4 % en enrutamiento de elección y 26,7 % en tipo de commit en una prueba independiente.

• Calibración — Laya: ECE 0.466 en producción, 0.081 tras el reajuste de temperatura por tipo de pregunta. von: temperatura escalada a T=1.1692 durante el post-entrenamiento de RLCD, afirmó un ECE casi ideal en su propia distribución.

• Servicio — Laya: pip install laya, además de ports comunitarios de ONNX, Go y Apple MLX. von: SDKs de Python y TypeScript, un servidor HTTP mediante von serve, presets preempaquetados para triaje de tickets, seguridad de correo electrónico, moderación y triaje de eventos de seguridad.

• Hardware — Laya: CPU, CUDA y Apple MPS. de: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS y CPU multihilo.

• Licencia — Apache 2.0 para ambos.

La parte de von que es genuinamente distintiva

Los patrones composables de von son lo menos discutido de su repositorio. El control por umbral de confianza, el despacho de rutas, la puntuación compuesta y el enrutamiento en dos etapas se distribuyen como patrones con nombre propio junto a los presets —triaje de tickets, seguridad del correo, moderación, triaje de eventos de seguridad— y codifican la arquitectura que un modelo de decisión realmente necesita en producción. Una sola choice llamada rara vez constituye el sistema completo; la forma útil es un router económico de primera etapa que despacha a una segunda etapa especializada, con una puerta de confianza que escala los casos inciertos. von incluye eso como un patrón documentado en lugar de dejártelo a ti.

Eso encaja limpiamente con lo que hace OrcaRouter en el lado generativo, lo cual vale la pena decir sin rodeos porque las dos mitades del patrón normalmente las construyen equipos distintos. Ni von ni Laya están alojados en OrcaRouter —ambos son pesos que se descargan y se ejecutan— y nada de esto debe interpretarse como una afirmación de que los servimos. Lo que sí está en nuestra lista es la otra mitad: más de 200 modelos generativos detrás de una única clave compatible con OpenAI a precio de lista del proveedor transferido con 0 % de margen, de modo que una rebaja de precio de un proveedor llega a tu factura el mismo día en lugar de en la renovación. Si la puerta de confianza de von decide que el 4 % de las solicitudes necesita un modelo de frontera, el DSL de enrutamiento es lo que compone esa decisión en una sola llamada en lugar de dos contratos y dos SDK, y la conmutación por error automática es lo que evita que la rama costosa sea un único punto de fallo.

¿Qué hacer con dos modelos que fallan ambos fuera de su distribución de entrenamiento?

La conclusión práctica de la evaluación de von no es que von sea un mal modelo. Es que la precisión publicada de un modelo de decisión es una afirmación sobre su distribución de entrenamiento, y la única forma de saber si tu problema está dentro de esa distribución es probarlo. La propia tabla comparativa del README de von se compara con GLiNER2, un Qwen3.5 4B ajustado, Laya y Jev de TypeSafe en tamaño, precisión, latencia y alojamiento — lo cual es una tabla útil, y también una tabla en la que cada entrada de precisión, excepto una, proviene del propio banco de pruebas del autor.

Entre ambos: elige von si quieres un conjunto más amplio de dominios publicados, una huella ligeramente menor, patrones de servicio preconstruidos para triaje y moderación, y la evidencia de ViZDoom de que maneja bien decisiones rápidas sobre texto estructurado. Elige Laya si necesitas entrada multilingüe —von no tiene checkpoint multilingüe y la variante mmBERT de 322M de Laya cubre más de 100 idiomas—, o si una cifra de 32,8 ms en T4 y una ventana de 512 tokens en inglés encajan con tu carga de trabajo. No elijas ninguno sin pasar una tarde etiquetando unos cientos de ejemplos de tu propio tráfico y ejecutando ambos contra ellos. La propia documentación de ambos proyectos te apunta a ese experimento, y el resultado de terceros de von es lo que ocurre cuando nadie lo lleva a cabo.

Lo único que cambiaría esta comparación es una evaluación emparejada sobre entradas idénticas con un diagrama de fiabilidad para cada modelo. No existe. Hasta que exista, la clasificación honesta se basa en la calidad de la evidencia y no en la puntuación: Laya ha publicado su peor número, von ha publicado su mejor número, y la prueba independiente de von es lo más parecido que cualquiera de los dos tiene a una verificación externa.

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."