
Laya vs Nimble: Datos contrastivos frente a un codificador más rápido
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Laya y Nimble son los dos modelos de decisión de pesos abiertos cuyos autores hicieron más por explicar cómo se construyeron, y sus explicaciones no coinciden sobre dónde reside la dificultad. Convai Innovations lanzó Laya el 18 de septiembre de 2026 bajo Apache 2.0 — un checkpoint en inglés ModernBERT-large de 421M, un checkpoint multilingüe mmBERT-base de 322M que cubre más de 100 idiomas, un enrutador de sub-milisegundo entre ellos, y un p50 publicado de 32.8ms por decisión en una Tesla T4. Bespoke Labs construyó Nimble como un ajuste fino LoRA sobre Qwen3.5-9B, Apache 2.0, y lo describe como "el Jev de código abierto" — inspirado en el Jev de TypeSafe AI pero sin usar ni sus pesos, ni su arquitectura, ni una destilación de sus salidas. La respuesta de Convai al problema de precisión es la velocidad y una base ajustable finamente. La respuesta de Bespoke son los datos de entrenamiento. Esa diferencia merece más atención que la brecha de precisión de tres puntos que aparece en las tablas principales.
La afirmación que cada proyecto está haciendo en realidad
La afirmación de Laya es arquitectónica. Es no autorregresiva en el sentido estricto: un codificador bidireccional, sin bucle de decodificación, sin JSON que analizar, sin espacio en el que emitir texto fuera del tipo declarado. Esa garantía estructural es la misma que ofrece Jev, alcanzada desde una dirección distinta, y es verdaderamente valiosa para cualquiera que haya escrito lógica de reintentos en torno a un modelo que de vez en cuando olvida cerrar una llave. El coste es que un codificador de 421M con una ventana de 512 tokens y sin preentrenamiento generativo detrás no sabe gran cosa. Convai lo dice en la tarjeta del modelo: "Laya es una base rápida para especializar, no un motor de decisiones zero-shot."


La afirmación de Nimble es sobre los datos. El método de Bespoke es la curación contrastiva, adaptada del trabajo anterior del equipo, Bespoke-MiniCheck: escribir dos ejemplos casi idénticos que difieran en un “hecho focal”, de modo que la etiqueta correcta se invierta. El pipeline consta de cuatro pasos declarados —comprobar que las reglas de decisión podrían realmente dar lugar a respuestas diferentes, construir el par cambiando como máximo ocho palabras, verificar ambos ejemplos con llamadas separadas al modelo más una comprobación de eliminar cada oración, y generar etiquetas en código conservando solo los pares cuyas etiquetas difieren realmente—. El objetivo no son más ejemplos, sino ejemplos más precisos: forzar al modelo a aprender qué evidencia debería cambiar la decisión. Esa es una teoría diferente de por qué fallan los modelos de decisión pequeños, y es más interesante que otro punto de exactitud.
Lo que los números publicados realmente respaldan
Nimble reporta un 90,12 % de concordancia con las etiquetas de referencia en 324 muestras reservadas, frente al 93,21 % de Jev, el 66,36 % del modelo base Qwen3.5-9B sin ajustar y el 84,88 % de un Qwen3.8 de 27B sin ajustar. Reporta una mediana de aproximadamente 106 ms en una H100 y una mediana de 444 ms en un M5 Pro con 64 GB. Esas son cifras del propio arnés de evaluación de Bespoke. El conjunto de evaluación de 324 muestras es la parte que hay que sopesar con cuidado, y el proyecto mismo explica por qué: las muestras abarcan seis de las diez familias de fuentes de entrenamiento, fueron generadas y validadas por modelos sin revisión humana y, por lo tanto, la generalización a categorías no vistas no está demostrada. Cuando un modelo se entrena con un método de curación de datos y luego se evalúa sobre una partición reservada de esa misma distribución curada, la cifra de exactitud es una afirmación sobre la consistencia interna del método, no sobre tu tráfico.
Los números de Laya vienen del otro extremo. En el benchmark de decisiones tipadas de TypeSafe obtiene 0,362 en zero-shot —el azar es 0,318, la línea base de la clase mayoritaria es 0,461— y 0,766 cuando se ajusta finamente en el propio conjunto de entrenamiento del benchmark. En Banking77, 77 etiquetas, obtiene 0,425 frente a 0,870 de Jev, que es la ilustración más clara de su techo con muchas opciones. En AG News con cuatro etiquetas obtiene 0,950 frente a 0,910 de Jev; en DAIR Emotion con seis etiquetas, 0,595 frente a 0,480. Su error de calibración se entrega en 0,466 y baja a 0,081 tras el reajuste de temperatura por tipo de pregunta. Una prueba de terceros de 100 mensajes de urgencia de Mars-base tuvo a Jev en 100/100 y a Laya en 53/100. Y en una evaluación independiente de llamadas a herramientas de agente, Laya logró un recall de rechazo del 100 % en llamadas peligrosas, pero solo al marcarlo todo, lo que es un fallo de precisión disfrazado de victoria de seguridad.
Coloque los dos conjuntos de números uno al lado del otro y la lectura honesta es que se midieron en cosas diferentes. El 90,12 % de Nimble es concordancia con sus propias etiquetas de referencia curadas. El 0,362 de Laya es un benchmark que no construyó. Ninguno de los dos números es trasladable.
Calibración: el único lugar donde ambos proyectos son inusualmente francos
Aquí es donde los dos proyectos están más cerca en espíritu y más lejos en cuanto a resultados.
El README de Bespoke advierte explícitamente que las probabilidades de Nimble son logits normalizados con softmax sobre los candidatos proporcionados, no tasas de acierto calibradas; un 0,9 no significa 90 % correcto. Recomienda añadir una opción "ninguna de las anteriores", porque si la respuesta correcta no está entre los candidatos, uno de ellos aun así gana. En una evaluación más reciente de 3.880 registros que abarca 13 subconjuntos, Jev tuvo un error de calibración reportado más bajo en 11 de 13 subconjuntos y una puntuación de Brier más baja en 10 de 13. Por lo tanto, una coincidencia de etiquetas similar no implica una calidad de probabilidad similar, y Bespoke lo dice.
La divulgación de Convai es la imagen especular: el error de calibración esperado de 0.466 está en la tarjeta, junto al 0.081 que produce el reajuste de temperatura por tipo de pregunta. Ninguno de los dos proyectos entrega un modelo cuya confianza puedas usar sin trabajo. Ambos te lo dicen por escrito. Si estás construyendo un umbral de confianza —liberación automática por encima de 0.95, escalar por debajo de 0.7—, la documentación de ambos autores te dice lo mismo: ajusta primero el umbral con tus propios datos etiquetados.
La comparación, dimensión por dimensión
• Arquitectura base — Laya: encoder ModernBERT-large de 421M, bidireccional, sin preentrenamiento generativo. Nimble: Qwen3.5-9B con un ajuste fino de LoRA, base generativa conservada.
• Idiomas — Laya: más de 100 mediante el checkpoint multilingüe de 322M. Nimble: inglés.
• Presupuesto de prompt — Laya: 512 tokens en inglés, 1.024 multilingüe. Nimble: 2.048 tokens como máximo por prompt, solo esquemas planos, enumeraciones limitadas a 26 opciones por campo.
• Velocidad — Laya: 32,8 ms p50 en una T4, 7,2 ms por pregunta en lotes de 10. Nimble: aproximadamente 106 ms de mediana en una H100, 444 ms en un M5 Pro de 64 GB.
• Hardware — Laya: CPU, CUDA y Apple MPS; menos de un gigabyte residente en el port de MLX. Nimble: GPU CUDA BF16 para las cifras indicadas, con soporte para las rutas MLX y CUDA.
• Precisión reportada — Laya: 0,362 en zero-shot, 0,766 con ajuste fino, 0,425 en Banking77. Nimble: 90,12 % en 324 muestras retenidas seleccionadas frente al 93,21 % de Jev.
• Método — Laya: primero la arquitectura, ajuste fino por despliegue. Nimble: curación contrastiva de datos, publicada como receta.
• Licencia — Apache 2.0 para ambos.
Dos restricciones de esa lista merecen leerse dos veces antes de decidirte. El límite de 26 opciones por enumeración de Nimble y el techo de 2,048 tokens por prompt son límites estrictos del esquema, no una degradación del rendimiento — si tu taxonomía tiene cuarenta etiquetas o tu prompt incluye un documento largo, Nimble es la herramienta equivocada, independientemente de su precisión. Y Nimble puntúa cada campo de forma independiente, así que cualquier regla de consistencia entre campos —«si A es verdadero, entonces B debe ser falso»— tiene que vivir en tu código, no en el modelo.
Por qué la receta de datos es el artefacto más portátil
Este es el argumento a favor de Nimble que las tablas de precisión pasan por alto. Bespoke publicó el pipeline de curación, no solo los pesos. Si tu problema de decisión tiene una taxonomía fija y puedes escribir las reglas, el método contrastivo es algo que puedes ejecutar con tus propios datos y tus propios hechos de interés, sobre cualquier modelo base que prefieras. El LoRA de 9B es tanto una demostración del método como un producto.
La portabilidad de Laya es diferente y complementaria. Porque es pequeña, porque se ejecuta en CPU y porque existen los ports de ONNX y MLX, Laya es el modelo que puedes colocar dentro de un proceso que no tiene GPU ni red. En un benchmark de agentes de navegador de terceros, Laya completó 0 de 50 tareas y declaró la finalización prematuramente en 33 intentos, pero los autores del benchmark señalan que fue entrenada para trabajo de juicio como tickets de soporte y revisión de trazas de agentes, no como navegación. Lee eso como una declaración de alcance en lugar de un veredicto, y es consistente con el enfoque de ambos proyectos: son componentes para una clase específica de decisión, no agentes generales.
Ni Laya ni Nimble son modelos alojados en OrcaRouter. Ambos son pesos que ejecutas tú mismo, y nada en este artículo debe interpretarse como una afirmación de que nosotros los servimos. La razón por la que el producto de enrutamiento surge siquiera es la misma razón por la que surge en cualquier arquitectura de modelo de decisión: el modelo de decisión responde a una llamada, y la aplicación que lo rodea todavía necesita prosa. Un pipeline que usa Nimble para evaluar si un borrador es conforme y Laya para enrutar la excepción todavía va a necesitar un modelo generativo para escribir el borrador. Mantener esa mitad generativa en un único endpoint compatible con OpenAI — más de 200 modelos, precio de lista del proveedor pasado con 0% de margen de modo que una rebaja de precio de un proveedor se aplique el mismo día, conmutación por error automática entre proveedores — significa que la capa de decisión se puede cambiar sin tocar el contrato de la capa generativa.
El veredicto, y el experimento que lo cambiaría
Elige Nimble si tu taxonomía es fija y estrecha, tus entradas son en inglés y cortas, tienes una GPU y quieres la receta de datos tanto como el modelo. Elige Laya si necesitas entradas multilingües, un presupuesto inferior a 40 ms o un proceso sin GPU alguna — y presupuesta el ajuste fino desde el principio, porque el checkpoint de zero-shot está por debajo de la línea base trivial y la tarjeta del modelo lo dice.
El experimento que lo resolvería es una evaluación emparejada sobre tráfico real: mismas entradas, mismos conjuntos de opciones, mismos umbrales de confianza, evaluados contra etiquetas humanas, con un diagrama de fiabilidad para cada uno. La propia documentación de Nimble advierte que sus probabilidades no son tasas de corrección y la ficha de Laya informa un error de calibración de 0,466 antes del reajuste, así que ese diagrama es el artefacto que realmente te diría qué modelo poner delante de producción. Ningún proyecto ha publicado uno, y ninguno ha publicado el del otro. Constrúyelo con tus propios datos antes de fijar un umbral.

