
Jev vs Laya: 33 milisegundos en una T4, y una línea base aleatoria
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La model card de Laya contiene la frase que decide esta comparación, y fue escrita por las personas que crearon Laya. «Laya es una base rápida para especializar, no un motor de decisiones zero-shot». Convai Innovations lanzó Laya el 18 de septiembre de 2026, tres días después de que TypeSafe AI lanzara Jev, bajo Apache 2.0, con los pesos en Hugging Face y un punto de entrada pip install laya. Responde preguntas tipadas en una sola pasada forward, sin decodificación token a token, que es la misma apuesta arquitectónica que hace Jev. La afirmación principal es una latencia p50 de 32,8 milisegundos por decisión en una Tesla T4, presentada como aproximadamente 7,8 veces más rápida que los 236–276 ms de p50 que Jev publica a través de su API alojada. La afirmación es real y, además, está midiendo dos cosas distintas —una GPU local frente a una llamada de red—, y el panorama de precisión que subyace es la parte que debería determinar si lo descargas o no. En modo zero-shot, Laya obtiene 0,362 en el benchmark de decisiones tipadas de TypeSafe. Adivinar al azar obtiene 0,318. La línea base de la clase mayoritaria obtiene 0,461. Laya, tal como viene de fábrica, está más cerca del azar que de la línea base trivial.
Qué es Laya en realidad

Laya se distribuye como dos checkpoints detrás de un enrutador integrado que dirige cada entrada al que corresponde. El checkpoint en inglés es ModernBERT-large, con 421 M de parámetros y un contexto de 512 tokens. La variante multilingüe es mmBERT-base, con 322 M de parámetros y una ventana de 1.024 tokens en más de 100 idiomas. Ambos son no autorregresivos: una sola pasada hacia delante devuelve la respuesta, así que no hay bucle de decodificación, ni JSON que analizar, ni espacio en el que emitir texto fuera del tipo declarado. Esa última propiedad es la misma garantía estructural que ofrece Jev, a la que se llega desde una dirección distinta, y es realmente valiosa para cualquiera que haya escrito lógica de reintentos en torno a un modelo que de vez en cuando olvida cerrar una llave.
Jev es la contraparte cerrada: el primer modelo System One de TypeSafe AI, lanzado el 15 de septiembre de 2026, alojado y de acceso anticipado, con tres primitivas tipadas —Choice a partir de una lista que tú proporciones, Score sobre una rúbrica ordenada y Noul, una afirmación de sí/no con una probabilidad calibrada. Todas las preguntas se evalúan en paralelo contra una única lectura compartida del estado, la salida es gratuita porque no hay tokens de salida, y la entrada cuesta $0.042 por millón de tokens. Su arquitectura, número de parámetros y cómputo de entrenamiento no se divulgan, y TypeSafe ha dicho que los detalles se mantienen en reserva, con un artículo posiblemente más adelante.
La afirmación sobre la latencia, medida correctamente
El p50 de 32,8 ms de Laya en una T4 es un número real y bueno. La comparación de 7,8x contra los 236–276 ms de Jev es donde hay que tener cuidado, y la propia ficha de Laya es inusualmente honesta sobre por qué: las cifras de Jev son números publicados por terceros que Convai nunca midió por su cuenta, y la comparación contrapone una pasada hacia adelante en una GPU local con una llamada a una API alojada que incluye ida y vuelta de red y encolamiento. Si se quita la red, la comparación arquitectónica es entre dos modelos de una sola pasada: uno con 421 M de parámetros y otro con un tamaño no revelado que TypeSafe nunca ha publicado.
También hay un número de batching que conviene conocer: con un lote de diez, Laya reporta 7,2 ms por pregunta. Esa es la forma del producto. Laya está hecho para ejecutarse localmente en volumen, y las adaptaciones comunitarias en el dispositivo, como laya-mlx, lo extienden a Apple Silicon. Las afirmaciones virales de que es «50 veces más rápido que Jev» no están respaldadas por los benchmarks publicados del propio proyecto, y el encuadre honesto es una gran brecha entre lo local y la nube que es en parte arquitectónica y en parte simplemente la diferencia entre tu GPU y la API de otra persona.
Lo que dicen los números de precisión, en orden
Aquí es donde la comparación deja de ser halagadora, y merece la pena exponerla en orden porque el orden importa.
• Zero-shot en el benchmark typed-decisions de TypeSafe — Laya 0.362, aleatorio 0.318, clase mayoritaria 0.461, Jev 0.727. Laya está por encima del azar y por debajo de la línea base trivial.
• Ajustado finamente en la propia división de entrenamiento del benchmark — Laya 0.766 frente a Jev 0.727. Laya gana, y la victoria proviene de un checkpoint que ha visto los datos de entrenamiento del benchmark, lo que lo convierte en una afirmación sobre el ajuste fino, no sobre el modelo base.
• Clasificación de intenciones de Banking77, donde el conjunto de opciones es grande — Laya 0,425 frente a los 0,870 de Jev's. Laya se degrada drásticamente a partir de aproximadamente 20 opciones, y los campos Choice de Jev's están documentados para manejar hasta 255 antes de que se necesite el patrón de puntuación en dos etapas.
• Calibración — Laya se distribuye con un error de calibración esperado medio de 0,466, que mejora a 0,081 solo después de reajustar la temperatura por tipo de pregunta. Jev se entrena con un método al que TypeSafe llama RLCD, Reinforcement Learning for Calibrated Decisions, y entrega cada respuesta con una distribución de probabilidad —aunque TypeSafe también indica a los usuarios que validen los umbrales con sus propios datos etiquetados, y una auditoría independiente descubrió que la calibración de Jev varía drásticamente según la tarea.
El patrón es inequívoco. Laya es una base sólida para el ajuste fino y un motor de decisión zero-shot débil, y ella misma lo dice. Jev es un motor de decisión zero-shot sólido cuya calibración aún debe comprobarse en cada despliegue. Son productos diferentes con estructuras de precios diferentes, y elegir entre ellos es sobre todo una cuestión de si tienes datos etiquetados y un bucle de entrenamiento.
La aritmética de costes no tiene la misma forma que la de Jev
Jev cuesta $0,042 por millón de tokens de entrada, con la salida gratuita, lo que equivale a $42 por mil millones, y una llamada de tamaño máximo con el presupuesto de solicitud documentado de ~32.000 tokens cuesta bastante menos de un centavo. La prueba independiente de Every realizó 777 juicios repartidos en 37 documentos por aproximadamente un cuarto de centavo.
El coste por llamada de Laya es cero en el margen y distinto de cero en agregado, y el agregado no es pequeño. Un modelo de 421 M de parámetros en una T4 es barato de ejecutar y aun así te cuesta una GPU, y el paso de ajuste fino que hace que Laya sea competitiva es donde reside el gasto real: el etiquetado de datos, la ejecución de entrenamiento, el arnés de evaluación y el reajuste de temperatura por tipo de pregunta que lleva su error de calibración de 0,466 a 0,081. Para una taxonomía fija que nunca cambia, ese es un coste único que se recupera con volumen. Para una taxonomía que deriva, es un coste recurrente, y la línea base de cero disparos de Jev de 0,727 se convierte en una opción mucho más ventajosa.
Hay un tercer costo que es fácil pasar por alto: el checkpoint en inglés de Laya tiene una ventana de contexto de 512 tokens. Eso no es un modelo de decisión con un presupuesto de contexto pequeño — es un modelo de decisión dimensionado para un párrafo. El presupuesto de solicitud de aproximadamente 32.000 tokens de Jev es sesenta veces mayor, e incluso así está un orden de magnitud por debajo de los modelos generativos con los que se compara el precio de ambos. Si tu estado es un hilo de soporte en lugar de un mensaje de soporte, la ventana de ninguno de los dos modelos es la restricción contra la que deberías optimizar.
La cuestión del despliegue es la verdadera diferencia

El argumento más sólido de Laya no es la latencia. Es que los pesos con Apache 2.0 en Hugging Face implican que la decisión nunca sale de tu infraestructura y que el endpoint nunca tiene un límite de solicitudes. Para una decisión de enrutamiento tomada sobre un registro médico, un documento legal o el historial de cuenta de un cliente, eso no es una preferencia — es el factor decisivo, y ningún endpoint alojado, a ningún precio, gana ese argumento. Jev de TypeSafe está en acceso anticipado y con lista de espera, y su propia documentación señala que los límites de solicitudes pueden cambiar sin previo aviso.
El contraargumento es aquello a lo que renuncias. La arquitectura más grande y no revelada de Jev está haciendo el trabajo que los 421 M de parámetros de Laya no pueden hacer: la brecha zero-shot de 0,727 frente a 0,362 y la brecha de Banking77 de 0,870 frente a 0,425 son ambas medidas de cuánto conocimiento reside dentro del modelo antes de entrenarlo. La respuesta de Laya es que uno mismo aporta ese conocimiento mediante fine-tuning, y en un dominio fijo y estrecho esa respuesta funciona: el resultado de 0,766 con fine-tuning es la prueba.
Dónde se ubica la capa de decisión en una pila real
Ninguno de los dos modelos genera texto, así que ninguno es el flujo de trabajo completo. El patrón para el que ambos están diseñados es el de dos modelos: una capa de decisión que hace la llamada tipada y un modelo generativo que se encarga de la parte que necesita prosa, código o una explicación. OrcaRouter no sirve Jev ni Laya —Jev es el endpoint de acceso anticipado de TypeSafe y Laya son pesos que ejecutas tú mismo—, pero la mitad generativa de ese patrón es exactamente lo que cubrimos: más de 200 modelos tras una única clave compatible con OpenAI a precio de lista del proveedor, trasladado con un 0 % de recargo, así que un cambio de precio del proveedor está activo en nuestro lado el mismo día. La arquitectura de dos modelos se puede probar sin un segundo contrato con un proveedor y, con la conmutación automática por error, la ruta generativa no se convierte en un punto único de fallo mientras decides si la barata capa de decisión está lo bastante bien calibrada como para automatizar sobre ella.
El veredicto
Si tiene una taxonomía fija y estrecha, ejemplos etiquetados y un requisito de privacidad o latencia que descarte una API alojada, Laya es la opción más defendible y las cifras del ajuste fino lo respaldan. Si necesita que la decisión funcione sin configuración previa, si sus conjuntos de opciones superan las veinte categorías o si el estado es más largo que un párrafo, la propia ficha del modelo de Laya le dice que no es el producto para ese trabajo, y la puntuación de cero disparos de 0,362 frente a una línea base mayoritaria de 0,461 es la cifra que conviene tener a la vista cuando alguien le cite la cifra de latencia de 7,8x.
Lo que los dos tienen en común es más útil que lo que los separa. Ambos eliminan la clase de error que proviene del formato de salida y no hacen nada con la clase que proviene del juicio. Ambos entregan probabilidades, y ninguno tiene un diagrama de fiabilidad publicado en el que puedas confiar sin comprobarlo. Prueba la calibración con tus propios casos etiquetados antes de automatizar con cualquiera de los dos — la latencia ya está mercantilizada y el valor de confianza es la parte que hay que ganarse en cada despliegue.

