Tarjeta de título generada para RSI-Jev vs Laya que dice 'Dos modelos de decisión abiertos. Apuestas opuestas.', con una tarjeta izquierda etiquetada 'RSI-Jev v6.1-VL' que lleva un icono de cerebro con engranaje y la línea '4.69B de parámetros, zero-shot', una tarjeta derecha etiquetada 'Laya' que lleva un icono de pluma y la línea '421M de parámetros, hazle fine-tuning', un delgado separador vertical entre las dos tarjetas, y la leyenda 'Ambos son Apache-2.0. Ninguno de los dos está alojado para ti.' El logotipo de OrcaRouter está integrado en la esquina inferior derecha.
Guides & Insights

RSI-Jev vs Laya: Dos modelos de decisión abiertos, apuestas opuestas

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.

La primera apuesta tiene que ver con la escala. El checkpoint en inglés de Laya es ModernBERT-large, con 421 M de parámetros y un contexto de 512 tokens, y su checkpoint multilingüe es mmBERT-base, con 322 M y una ventana de 1.024 tokens que llega a 8.192 con el encoder configurado en modo extendido. RSI-Jev v6.1-VL ejecuta una torre completa Qwen3.5-4B-Base —4,69 mil millones de parámetros, 3,57 mil millones de ellos en las 32 capas del decodificador, más una torre de visión y tres cabezas de decisión en las capas 16, 20 y 32. Laya es un modelo del que puedes precargar tres en unos pocos gigabytes; RSI-Jev es un checkpoint bf16 de 9,7 GB. La segunda apuesta se deriva de la primera: Laya gasta casi nada por llamada y espera que le enseñes tu dominio, mientras que RSI-Jev gasta cuatro mil quinientos millones de parámetros tratando de responder a tu pregunta sin ningún entrenamiento en absoluto.

Para qué sirve realmente cada uno

La propia tarjeta de modelo de Laya contiene la frase que enmarca esta comparación mejor de lo que podría hacerlo cualquier reseñador: «Laya es una base rápida para especializarse, no un motor de decisiones zero-shot». En el benchmark de decisiones tipadas —2.000 decisiones en cuatro flujos de trabajo—, el checkpoint base en inglés obtiene 0,362, frente a 0,318 de la elección aleatoria y 0,461 de elegir siempre la clase mayoritaria. Sobre esas mismas decisiones, el checkpoint que Convai ajustó con la propia partición de entrenamiento de ese benchmark obtiene 0,766, superando el techo de 0,735 de concordancia con el profesor. Esa brecha es el producto: Laya es un codificador de 421M que ajustas con una taxonomía estrecha, y Convai ofrece un cuaderno de Kaggle que ejecuta todo el ciclo —construir el conjunto de datos, entrenar, ajustar temperaturas de calibración, evaluar— en dos T4 gratuitas.

RSI-Jev es el otro trade. Su versión v6.1-VL obtiene 50,98 en su propio Decision Index 0.3 público, una ejecución de 140.178 solicitudes de la configuración predeterminada, que en el tablero del proyecto con fecha 2026-10-06 empata con el mejor modelo 4B de allí y ocupa el puesto 27 de 113 en total. Su batería de quince benchmarks es de 0,793 y su conjunto reservado es de 0,729. Esas son cifras de zero-shot —aunque el proyecto tiene la precaución de señalar que diez de los quince benchmarks aportan datos de entrenamiento de alguna forma, así que «zero-shot» se aplica a la búsqueda de la versión, no a cada número de la página—. Lo que sí te dan las cifras es un modelo que responde a una pregunta sobre un documento que nunca le has mostrado y que no necesita una ejecución de entrenamiento previa.

• Tamaño — Laya 421M en inglés / 322M multilingüe frente a RSI-Jev 4,69B, ejecutando toda la torre Qwen3.5-4B-Base.

• Precisión zero-shot — Laya 0.362 en typed-decisions, por debajo de la línea base mayoritaria de 0.461, frente a RSI-Jev 50.98 en su propio Decision Index 0.3, igualando allí a la mejor entrada de 4B.

• Precisión con ajuste fino — Laya 0.766 con un checkpoint entrenado con la propia partición del benchmark frente a las cifras de RSI-Jev, que son de nivel de lanzamiento, no por dominio.

• Idiomas — Laya: 45 de 51 idiomas utilizables, más de tres veces el enrutamiento aleatorio del lado del servidor frente al texto centrado en inglés de RSI-Jev.

• Modalidad — solo texto de Laya frente a texto de RSI-Jev más hasta cuatro imágenes por solicitud.

• Contexto — Laya, 512 tokens en inglés, 1.024 en varios idiomas y hasta 8.192 para documentos largos, frente a RSI-Jev, con 32.768 tokens, que rechaza en lugar de truncar.

• Latencia — Laya 32,8 ms p50 en una T4, 7,2 ms por pregunta con lote de diez frente a RSI-Jev 22,5 ms con esfuerzo bajo y unos 40 ms a profundidad completa, en una H200.

El acantilado del recuento de opciones es la diferencia más marcada.

Ambos modelos definen el espacio de respuestas en el momento de la solicitud, por lo que un nuevo esquema no requiere reentrenamiento — esa es la ventaja estructural compartida de toda esta familia. Pero asignan el espacio de respuestas de forma diferente, y la diferencia se hace evidente justo en las tareas en las que suele darse el enrutamiento empresarial. Laya puntúa cada opción en su propio token enmascarado, y las opciones comparten un presupuesto fijo para la cabeza: 192 tokens en el checkpoint en inglés, 256 en multilingüe. En Banking77, con 77 intenciones, eso equivale a aproximadamente tres o cuatro tokens por etiqueta, y la precisión cae a 0,425. La propia ficha de Convai documenta el acantilado y ofrece la solución: aumentar head_max_len a 512 y el contexto a 1.024 o más para que cada etiqueta tenga espacio, o dividir un conjunto grande de opciones en una elección de dos pasos de grueso a fino.

La ruta de servicio de RSI-Jev admite hasta 5.120 opciones por pregunta. Eso no es una comparación en igualdad de condiciones con el 0,425 de Laya — los dos se midieron con arneses diferentes, y el techo de opciones es un límite de configuración, no una puntuación. Es una afirmación sobre cuál modelo no se caerá cuando tu taxonomía tenga cien entradas. Si tus preguntas de elección son «facturación / técnico / ventas / otro», cualquiera de los dos funciona. Si son alrededor de cien etiquetas de intención, uno de estos dos necesita ajustes antes de ser utilizable y el otro no.

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

Latencia, la cuestión del idioma y las imágenes

La afirmación sobre la latencia de Laya es su argumento más sonado, y es real: 32,8 ms p50 para una sola pregunta en una Tesla T4, 72,3 ms para un lote de diez y 337 ms para cincuenta — de 103 a 332 preguntas por segundo en una GPU modesta. Las cifras propias de RSI-Jev, cronometradas en una H200, son 22,5 ms con esfuerzo bajo, 26,8 ms con esfuerzo medio, 39,9 ms por defecto y 40,4 ms a profundidad completa. Están en el mismo orden de magnitud, y ambos son pasadas hacia adelante locales en lugar de llamadas de red, que es la comparación que realmente importa una vez que se descarta un endpoint alojado. Observa lo que ambos hacen con el tiempo: RSI-Jev puede detenerse deliberadamente en la capa 16 para conseguir esos 22,5 ms y ejecutar las 32 capas cuando la pregunta es difícil, y Laya no tiene ese control — siempre ejecuta todo su codificador (pequeño).

La historia de idiomas va en la dirección opuesta y es decisiva para cualquiera fuera del inglés. Laya incluye un router que detecta la escritura en mucho menos de un milisegundo y lo envía al checkpoint multilingüe, y su tabla publicada muestra 45 de 51 idiomas utilizables por encima de tres veces el azar, frente a 23 del checkpoint de inglés por sí solo. Su tarjeta también es honesta sobre por qué eso importa: el checkpoint de inglés colapsa con escrituras no latinas —el jemer obtiene 0.000 de precisión con 0.952 de confianza—, así que el filtrado por confianza no puede rescatar una ruta incorrecta. RSI-Jev no tiene una historia de idiomas de este tipo; es un modelo de texto centrado en el inglés que, casualmente, lee imágenes.

Las imágenes son la imagen especular. RSI-Jev acepta de una a cuatro por solicitud como URL de datos en base64 y obtuvo 0,834 en su conjunto de imágenes de reserva en esta versión; los checkpoints publicados de Laya son clasificadores de texto, y aunque existan ports de la comunidad como laya-vision en el Hub, no son el producto del proveedor. Si tu decisión se toma sobre una foto, un gráfico o una captura de pantalla, esa es la columna de uno de los modelos y no la del otro.

Ninguno de los dos se ha comparado con el otro mediante un benchmark.

Esta es la parte que una comparación especificación por especificación oculta discretamente: no hay un enfrentamiento directo entre estos dos modelos. Lo que existe es un enfrentamiento directo entre cada uno de ellos y el mismo modelo cerrado —el Jev 1.13 de TypeSafe—, y ninguno de los dos puede ponerse junto al otro.

Convai publicó uno: en typed-decisions, Jev 1.13.0 con 0.727 frente al 0.766 enrutado de Laya; en Banking77, Jev 0.870 frente al 0.425 de Laya; en calibración, Jev 0.246 frente al 0.081 de Laya tras la corrección de temperatura. Convai señala sus propios límites en la misma tabla — las cifras de Jev son publicadas por terceros, nunca tuvieron acceso a la API para medirlo, y los tamaños de muestra y los prompts difieren. La comparación de RSI-Jev es el Decision Index, que es el tablero público propio de RSI-Jev y no incluye ninguna entrada de Jev en absoluto. Así que los únicos números externos que tocan a ambos modelos provienen de arneses creados por las partes que los venden, y la lectura sensata de cualquier cifra individual anterior es «esto es lo que midió el fabricante, en la tarea del fabricante».

Lo que ambos proyectos hacen bien, y rara vez, es publicar sus propias debilidades. RSI-Jev nombra las cinco fuentes de imágenes no comerciales detrás de sus lanzamientos de visión y dice claramente que no está resuelto si los pesos entrenados con ellas heredan esos términos; informa de una regresión de calibración en su versión más reciente y califica su umbral de salida predeterminado como no confirmado. Laya documenta que sus checkpoints base se sitúan por debajo de la línea base de mayoría, que sus preguntas de puntuación ordinal son su primitiva más débil, que su noulpuede seguir sus propias etiquetas de opción en lugar del estado, y que uno de sus campos de respuesta no contiene ninguna señal utilizable. Esa honestidad es lo más útil que se puede heredar de cualquiera de los dos proyectos: comprueba los valores de confianza en tus propios casos etiquetados antes de automatizar en función de ellos.

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

Dónde se encuentra realmente el contrato que copian

Ambos modelos existen porque valía la pena copiar un formato de transmisión. El Jev de TypeSafe define la forma de la solicitud —estado, preguntas, tres primitivas tipadas— y la forma de la respuesta, y tanto Laya como RSI-Jev lo implementan para que un cliente existente funcione con solo cambiar una URL base. Ese modelo de referencia, typesafe/jev-1.13, es el único de los tres que servimos: está en nuestro catálogo en el endpoint dedicado systemone, un POST a /v1/systemone, sin streaming, con un contexto de 65.536 tokens, a $0,042 por millón de tokens de entrada y con la salida facturada a cero. Ni Laya ni RSI-Jev están en nuestro catálogo; ambos son descargas, y de eso se trata.

La versión práctica de eso importa más que la comparación. Las capas de decisión casi nunca están solas en una pila; se sitúan junto a un modelo generativo que escribe la respuesta, el resumen o el código. Tener el contrato de referencia en la misma clave que más de 200 otros modelos, a precio de lista del proveedor transferido con 0% de margen, significa que un cambio de tarifa del proveedor te llega el mismo día, y la conmutación por error automática significa que la mitad generativa de ese par no es un único punto de fallo mientras averiguas si la mitad de decisión barata es suficientemente buena. Si decides que un codificador autoalojado de 421M o un checkpoint de 4,69B es la elección correcta, igual quieres que el contrato con el que habla sea accesible desde el mismo lugar — y si prefieres no ejecutar ninguno de los dos, el modelo que ambos copian está a una solicitud de distancia.

¿Cuál descargar?

Elige Laya si tienes datos etiquetados, una taxonomía que no cambia mucho y una combinación de idiomas que no sea solo inglés. Es lo bastante pequeño como para ejecutar muchas instancias, lo bastante rápido como para ponerlo delante de cada solicitud y está diseñado desde cero para el ajuste fino: la puntuación de 0,766 con ajuste fino frente a 0,362 en zero-shot es todo el argumento. Reserva presupuesto para la ejecución de entrenamiento, el etiquetado y el reajuste de temperatura por tipo de pregunta, que lleva su error de calibración de 0,466 a 0,081, y mantén los conjuntos de opciones por debajo de unas veinte etiquetas o aumenta el presupuesto de la cabeza antes de confiar en una clasificación grande.

Elige RSI-Jev v6.1-VL si quieres que una decisión funcione sin ningún entrenamiento previo, si tus preguntas a veces son sobre una imagen, si tus conjuntos de opciones son grandes o si quieres sacrificar latencia a cambio de profundidad en cada solicitud. Prepárate para ejecutar un checkpoint de 9,7 GB en lugar de uno de 400M; prepárate para un proyecto que ha publicado ocho versiones en trece días y que puede publicar otra mientras evalúas esta; y prepárate para comprobar su calibración tú mismo: la propia ficha de esta versión dice que empeoró, no que mejoró.

Elijas el que elijas, dos cosas siguen siendo ciertas. Ninguno de los dos modelos genera texto, así que ninguno puede fallar al emitir un campo malformado; ambos devuelven probabilidades, y la probabilidad es la parte que hay que validar en cada despliegue en lugar de tomarla de una ficha. Y ambos han trasladado la interesante cuestión de la capa de decisión de «de quién es la API» a «de quién son los pesos», que es una pregunta mejor que hacerse, y una que este par responde de manera muy distinta.

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL vs Laya - the scoreboard', six rows across both columns: size, '4.69B parameters' against '421M English / 322M multilingual'; zero-shot, '50.98 Decision Index' against '0.362 typed-decisions'; fine-tuned, 'Not per-domain' against '0.766 on its own split'; languages, 'English-centric' against '45 of 51 usable'; modality, 'Text + up to 4 images' against 'Text only'; and latency, '~23-40 ms on an H200' against '32.8 ms p50 on a T4'. A footer reads 'Both vendor-reported; neither has been benchmarked against the other.'