Una tarjeta de título generada que dice «Jev vs Kev» sobre el subtítulo «Un ajuste fino de $95 que supera a Jev en tickets de soporte», contrastando Jev (cerrado, alojado, arquitectura no divulgada, $0.042 por millón de entrada, salida gratuita) frente a Kev (Apache 2.0, base Qwen3.5, 0.8B a 9B, unos $95 en tiempo de H100).
Engineering & Research

Jev vs Kev: Un ajuste fino de $95 que supera a Jev en tickets de soporte

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Jared Palmer publicó Kev el 20 de septiembre de 2026, cinco días después de que TypeSafe AI lanzara Jev, y el número importante no está en la tabla de benchmarks. Está en el README: todo costó alrededor de $95 en tiempo de H100 en Modal, más tres centavos de llamadas a la API de Jev usadas para generar datos de evaluación. Kev es Apache-2.0, autoalojable, y viene en tres tamaños construidos sobre los pesos base de Qwen3.5 —aproximadamente 0.8B, 4B y 9B— con un adaptador LoRA de rango 16 y una cabeza de puntero atornillada a una base congelada en lugar de un modelo de decisión creado desde cero. Refleja exactamente la API de decisiones tipadas de Jev: Choice, Score y Noul, lo suficientemente cerca como para ser compatible con el propio SDK de Python de TypeSafe. Jev, por su parte, se lanzó el 15 de septiembre de 2026 como el modelo System One cerrado y alojado de TypeSafe AI, devuelve respuestas tipadas con confianza calibrada y ningún texto en absoluto, y nunca ha publicado su arquitectura, número de parámetros, cómputo de entrenamiento ni pesos. La comparación, por lo tanto, no es realmente una comparación de modelos. Es una prueba de cuánto del valor de Jev sobrevive a ser reproducido en una tarde por el precio de una laptop usada.

Lo que realmente dicen los benchmarks

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability returned with every answer, free output, and the roughly 32,000-token request budget with a 255-option Choice cap.

El titular es que Kev se queda cerca y, en una tarea acotada, gana. En el conjunto de pruebas bloqueado de fuentes nuevas de Kev, Kev-9B obtuvo 0,837 frente a los 0,857 de Jev. En el enrutamiento de tickets de soporte a lo largo de 900 tickets —el conjunto scienthoon—, Kev-9B obtuvo 0,952 frente a los 0,897 de Jev, que es el único resultado publicado en el que la reproducción abierta supera al modelo que reproduce. Kev también se adelanta por poco en algunas tareas de reconocimiento lógico. En los conjuntos de decisión SemiF, un conjunto estructurado de 144 preguntas, Jev se lo lleva por 0,965 frente a los 0,917 de Kev-9B.

Donde Kev pierde, pierde mal. Precisión fuera de dominio: Kev-8B con 79,6 % frente al 85,7 % de Jev. MMLU: 70 % frente a 90 %. MMLU-Pro: 0,515 frente a 0,840. Aritmética de fechas con precisión de día: 60 % frente a 93 %. El patrón es consistente: Kev es competitivo en enrutamiento y clasificación de alcance limitado, donde el conjunto de etiquetas es pequeño y el dominio es fijo, y se desmorona en cualquier cosa que requiera conocimiento del mundo o aritmética de varios pasos, porque un adaptador de rango 16 sobre un modelo base pequeño congelado no es donde reside el conocimiento del mundo.

Todas esas cifras provienen del propio harness de Kev o de rastreadores de terceros, y el README de Palmer dice claramente que no es una comparación controlada —los datos de entrenamiento de Jev no se han divulgado, así que no hay forma de construir una. El README también afirma que no se usó ninguna salida de Jev para el entrenamiento. Ambas advertencias son de ese tipo que hacen que los números sean más confiables, no menos: la persona que publica la comparación es la que te dice lo que no puede demostrar.

Lo que obtienes por $95 que no puedes obtener de Jev a ningún precio

A screenshot of the Kev repository page for jaredpalmer/kev, showing the Apache-2.0 licence, the Qwen3.5 base weights, the rank-16 LoRA and pointer-head recipe, the about-$95 H100 training cost, and the README statement that no Jev outputs were used for training.

La comparación de costos es donde los dos productos dejan de ser comparables en absoluto. Jev cuesta $0.042 por millón de tokens de entrada con salida gratuita, lo cual es barato de una manera que resulta genuinamente difícil de superar por llamada — pero es una API alojada, de acceso anticipado y con lista de espera, y TypeSafe ha dicho que los límites de velocidad pueden cambiar sin previo aviso. Kev son pesos que descargas. El costo marginal de la diezmillonésima clasificación es tu propia electricidad.

De eso se derivan cuatro cosas, y ninguna de ellas tiene que ver con puntuaciones de benchmark.

• Ningún dato sale de tu infraestructura. Jev es un punto de conexión alojado; cada estado que le envías —el ticket de soporte, la línea de registro, el historial médico— va a TypeSafe. Kev se ejecuta en tu propia GPU, lo que, para cargas de trabajo reguladas, no es una preferencia, sino el factor decisivo.

• Sin límites de frecuencia, sin lista de espera, sin riesgo de depreciación. La propia documentación de TypeSafe señala que los límites de frecuencia pueden cambiar sin previo aviso. Un punto de control local no tiene esa cláusula.

• Puedes ajustarlo. Kev es una base para especializar, y la receta LoRA que lo produjo es pública. Si tu taxonomía de enrutamiento tiene 40 clases que ningún modelo general maneja bien, puedes entrenar con tus propias etiquetas — que es exactamente lo que hizo Palmer, a un costo medido en decenas de dólares en lugar de en un equipo de ML.

• El techo de contexto está en tus manos cambiarlo. El presupuesto de solicitudes documentado de Jev es de aproximadamente 32.000 tokens, y los campos Choice tienen un límite de 255 opciones. Kev hereda la ventana de Qwen3.5, que es mucho más grande, y el límite de opciones es un detalle de implementación de tu propia pila de servicio, no una limitación del proveedor.

Lo que Jev todavía tiene que Kev no tiene.

La afirmación sobre la calibración es la que no se transfiere limpiamente, y es el corazón del argumento de venta de TypeSafe. Jev se entrena con un método que TypeSafe llama RLCD — Reinforcement Learning for Calibrated Decisions — que optimiza que el valor de confianza sea honesto en lugar de que la respuesta sea la preferida. Cada respuesta de Jev viene con una distribución de probabilidad sobre las opciones, por lo que tu código puede establecer umbrales: actuar automáticamente en la banda superior, marcar en la intermedia, escalar en la inferior.

Kev produce la misma forma tipada y las mismas salidas de probabilidad, porque la API es deliberadamente compatible. Que esas probabilidades estén calibradas es una pregunta diferente, y la respuesta honesta es que nadie ha publicado un diagrama de fiabilidad para ninguno de los dos modelos. Una auditoría de calibración independiente reportó que Jev obtuvo una precisión del 44.7% con un error de calibración esperado de 0.325 en una tarea de prioridad de política oculta, lo que sugiere que la calibración en Jev varía drásticamente según la tarea en lugar de ser una propiedad universal — y TypeSafe mismo les dice a los usuarios que prueben los umbrales de confianza con sus propios ejemplos etiquetados en lugar de confiar en el comportamiento publicado.

La otra cosa que tiene Jev es que no fue entrenado con Qwen3.5. Un modelo de 9B con un adaptador de rango 16 tiene un techo de conocimiento, y la diferencia de MMLU-Pro de 0.515 frente a 0.840 es ese techo hecho visible. Si tu decisión de enrutamiento ocasionalmente requiere saber qué es una cosa, la arquitectura más grande y no revelada de Jev está haciendo un trabajo que el adaptador de Kev no puede hacer.

Latencia y la forma de despliegue

La latencia de extremo a extremo documentada de Jev es de 70–500 ms frente a 3–329 segundos para llamadas a LLM de frontera en la propia comparación de TypeSafe, y añadir preguntas a una llamada apenas la modifica porque cada pregunta se evalúa en paralelo contra una única lectura compartida del estado. Kev-9B en una H100 estará en el mismo orden de magnitud para una sola pasada hacia adelante, pero la comparación no es justa en ninguno de los dos sentidos: un 9B autoalojado en una GPU compartida bajo carga no tiene la misma latencia que un endpoint alojado, y un endpoint alojado no es lo mismo que una máquina en tu propio rack. Lo que se puede decir sin ambages es que ambos son lo suficientemente rápidos para el uso por turno en un bucle de agente, y que la latencia de Kev es una función del hardware que controlas en lugar de un nivel de servicio que te prometen.

La lectura honesta sobre la reproducción

El hecho de que Kev exista siquiera es evidencia sobre Jev, y vale la pena mencionarlo. Un modelo cerrado cuyo comportamiento puede aproximarse en cinco días por 95 dólares, por una sola persona, sobre pesos base públicos, te dice algo sobre cuánto de su ventaja es arquitectura y cuánto son datos de entrenamiento y servicio. De ahí no se sigue que Jev sea fácil de construir —la superficie de la API es fácil de copiar, y la calibración no lo es. Pero sí significa que la barrera no es la interfaz, y cualquiera que evalúe Jev para una ruta de producción debería contar con la posibilidad de que un ajuste fino de una base abierta les lleve la mayor parte del camino por una fracción del compromiso.

Lo cual es también el argumento para no apostar todavía una ruta de producción a ninguno de los dos. Si estás evaluando Jev, la postura sensata es probarlo sin comprometerte con él — y OrcaRouter no sirve Jev, porque el modelo de TypeSafe es de acceso anticipado y habla su propia forma de solicitud. Lo que sí cubrimos es la mitad generativa del flujo de trabajo en el que se insertan estos modelos de decisión: más de 200 modelos detrás de una sola clave compatible con OpenAI, al precio de lista del proveedor y traspasado con 0% de margen, con conmutación por error automática. Una arquitectura de dos modelos en la que una capa de decisión barata clasifica el tráfico y un modelo generativo se encarga del resto puede probarse de nuestro lado sin un segundo contrato con un proveedor, y si resulta que el componente de decisión está mal calibrado con tus datos, la ruta de conmutación por error es lo que evita que eso se convierta en un incidente.

El veredicto

Si tu tarea de decisión es acotada, de dominio fijo, de gran volumen y sensible a la privacidad, Kev es la opción más defendible hoy y no hay comparación — tú posees los pesos, controlas la ruta de los datos, puedes ajustar finamente con tus propias etiquetas y, en el enrutamiento de tickets de soporte, el checkpoint de 9B ya supera a Jev según sus propias cifras publicadas. Si tu tarea de decisión necesita conocimiento del mundo, aritmética de varios pasos o un valor de confianza con el que pretendes automatizar, el modelo más grande y no divulgado de Jev y su entrenamiento con RLCD están haciendo un trabajo real, y el adaptador de Kev no sustituye a ninguno de los dos.

Lo único que ninguna de las dos comparaciones resuelve es la calibración, porque nadie ha publicado un diagrama de fiabilidad para ninguno de los dos modelos. Pruébalo con tus propios casos etiquetados antes de automatizar contra cualquiera de los dos: el valor de confianza es la parte de ambos productos que tiene que ganarse en cada despliegue, y la velocidad es la parte que ya está mercantilizada.

A generated two-column scoreboard comparing Jev and Kev across the same six labelled dimensions, with a footer reading "Kev figures per its own README and harness; not a controlled comparison."