Una tarjeta hero generada titulada '¿Qué es TypeSafe AI?' con el subtítulo 'El laboratorio detrás de Jev 1.13: decisiones tipadas, no prosa', sobre tres líneas etiquetadas: 'Empresa: TypeSafe AI, San Francisco', 'Modelo: Jev 1.13 (typesafe/jev-1.13), lanzado el 2026-09-15' y 'Enrutado en OrcaRouter desde el 2026-09-24'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

¿Qué es TypeSafe AI? El laboratorio detrás de Jev 1.13 toma decisiones, no oraciones

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

TypeSafe AI es un pequeño laboratorio de San Francisco que vende un modelo que no puede escribir una frase, y Jev 1.13 (typesafe/jev-1.13) es el modelo en cuestión. Toma una pieza de estado —un correo electrónico, una línea de registro, un ticket de soporte, un blob JSON— más un conjunto de preguntas con nombre, y devuelve una respuesta tipada por pregunta, cada una con su propio valor de confianza. Sin prosa, sin código, sin explicación y sin cuadro de chat. El propio modelo se lanzó el 15/09/2026, así que no es nuevo y nada de esto es una historia de lanzamiento: esta página existe por un cambio más pequeño y fechable. El 24/09/2026, OrcaRouter añadió typesafe/jev-1.13 a su catálogo y abrió la ficha del modelo en su propia dirección, lo que fue la primera vez que se pudo llamar a Jev a través de una pasarela de terceros en lugar de solo mediante el endpoint propio de TypeSafe. Ese es el acontecimiento; tiene seis días de antigüedad al 30/09/2026, y es la razón por la que un lector que aún no tiene un contrato con TypeSafe ahora puede poner un modelo System One en la misma clave que los modelos generativos junto a los que está diseñado para convivir. Todo lo demás en esta página son antecedentes sobre la empresa que lo creó.

El encuadre honesto de los tiempos, porque importa para saber cuánto de esto está verificado: Jev se lanzó hace más de dos semanas y ha estado disponible de forma general desde el 2026-09-21, cuando TypeSafe eliminó su lista de espera. Lo que está dentro de la ventana de siete días es el cambio de enrutamiento, no el modelo. Si viniste aquí esperando una reseña del lanzamiento, el lanzamiento ya ocurrió y un puñado de otros artículos lo cubrieron.

Una página de empresa con un manifiesto y sin diagrama de arquitectura

TypeSafe se describe a sí misma, en su propia metadescripción, como "un laboratorio de IA que construye infraestructura de inteligencia nativa de máquina para la automatización", con sistemas "diseñados para tomar decisiones dentro del software". Su página de inicio lleva el sello de la Versión 0.01 y en el pie dice "Hecho en SF". Hay un manifiesto que sostiene que el camino más corto hacia un cambio económico con forma de IA pasa por hacer que la inteligencia sea componible, de modo que el software pueda invocar juicio semántico tal como invoca una función; el propio resumen que hace la empresa de su plan es lanzar la forma de IA componible nativa de máquina, luego hacerla lo bastante confiable para la automatización real y después ofrecer abstracciones de nivel superior, lo bastante estables como para construir capas sobre ellas. Su lema es "Estamos construyendo prod, no a Dios". La página del equipo nombra a tres fundadores —Diogo Almeida como CEO, Sasha Sheng como COO y Erik Gafni como CTO—. Eso es todo lo que la empresa dice sobre sí misma: una postura, un producto, tres nombres y ninguna cifra sobre la propia empresa.

Lo que el sitio no incluye es lo primero a lo que recurre un ingeniero que evalúa una nueva dependencia. No hay página de arquitectura, ni recuento de parámetros, ni divulgación del cómputo de entrenamiento, y no hay model card en el sentido académico. El propio panel de benchmarks de TypeSafe todavía figura como pendiente. Para una empresa cuyo argumento de venta se basa en la fiabilidad, la superficie de divulgación es escasa, y eso es un hecho sobre lo que se ha publicado, no una acusación sobre lo que se oculta.

A headless-browser capture of the TypeSafe AI homepage as it stood on 2026-09-30. A navigation bar reads 'TypeSafe AI | Manifesto | Our Team | Docs | Sign In'. Under it a banner announces 'NO MORE WAITLIST / TypeSafe is now open to everyone' above a 'Create your account' button, next to a blog teaser reading 'TypeSafe announces System One models and Jev' with a 'Read more' link. Lower down, a section headed 'Introducing Jev - the First Public System One Model: Jev Gives AI The Properties Of Code' appears beside a 'Join Discord' button and the tagline fragment 'Intelligence beyond chat'.

System One: la categoría, y por qué se toma prestado el nombre

Jev es el primero de lo que TypeSafe llama modelos System One. El nombre proviene de la división que hace Daniel Kahneman entre el pensamiento rápido e intuitivo del Sistema 1 y el razonamiento lento y deliberado del Sistema 2, y la publicación de lanzamiento de la empresa lo dice directamente — también admite que "el pensamiento del Sistema 1" ha tenido una connotación de propenso a errores, y sostiene que estos modelos pueden volverse más fiables que las alternativas. TypeSafe no acuñó el término ni es propietaria de él.

El contenido práctico de la categoría es una división deliberada del trabajo: un modelo que decide y un modelo que escribe. Se supone que debes mantener la aritmética, el orden de fechas, el conteo y la comparación de cadenas en código normal, donde son exactos, y entregar el juicio semántico a Jev. Tres tipos de preguntas son las que puede responder:

• noul — un juicio de verdadero/falso, devuelto con una probabilidad calibrada

• opción — elige una de hasta 255 opciones etiquetadas

• puntuación — valorar en una escala ordenada; nuestra tarjeta publica niveles del 2 al 10, y la propia documentación de TypeSafe muestra un ejemplo indexado desde 0, así que considera los niveles del proveedor como la definición y los del 2 al 10 como lo que publica la tarjeta.

Cada pregunta lleva sus propias instrucciones y, para la elección y la puntuación, sus propios criterios. Las solicitudes de más de aproximadamente 64K tokens de entrada se rechazan antes de que lleguen al modelo, y las respuestas no se transmiten en streaming. El proveedor documenta por separado el presupuesto de estado —el estado más la única pregunta más larga— en 32K tokens, que es una cifra más estrecha que el contexto de 65.536 tokens de la tarjeta y no una contradicción de esta.

Su tesis, en sus propias palabras

TypeSafe enuncia la tesis mejor de lo que lo haría cualquier resumen, así que aquí está, literal: «Los LLM producen palabras para las personas. Jev produce decisiones tipadas y se parece más al código: fiable, rápido, autoconsistente y con seguridad de tipos». El método de entrenamiento que hay detrás también es suyo, y es un término que vale la pena atribuir precisamente porque se ha retomado en otros lugares como si fuera genérico. TypeSafe lo llama Reinforcement Learning for Calibrated Decisions, o RLCD, y lo contrasta con RLHF y RLVR: mientras que esos optimizan la preferencia humana o las recompensas verificables programáticamente, RLCD apunta, en palabras de la empresa, a «respuestas con probabilidades epistémicamente honestas en tareas de Sistema Uno». Considera RLCD una acuñación propia de TypeSafe, no un acrónimo establecido en la literatura.

Los números con los que abren, y quién eligió la carga de trabajo

La página de inicio abre con "193.6x más rápido, 444.6x más barato", con una nota al pie que hace referencia a flujos de trabajo para tareas de System One. Debajo hay un ejemplo práctico: TypeSafe AI a $0.000081 y 0.114 segundos frente a LLMs a $0.013880 y 8.566 segundos. Más abajo, "$42 por mil millones de tokens de entrada. Precio de entrada 238x más bajo que Claude Fable 5.1". Y una sección titulada "Cero alucinaciones", que al examinarla es una afirmación sobre estimaciones de confianza más que una prueba de cero errores: cada decisión de Jev conlleva una estimación de confianza, de modo que el software puede actuar cuando la confianza es alta y escalar cuando no lo es. Las cuatro son cifras de TypeSafe, en cargas de trabajo que TypeSafe eligió, y ninguna ha sido replicada de forma independiente. La publicación de lanzamiento dice que el equipo espera que sus 193.6x y 444.6x se sitúen en el extremo superior de las ganancias del mundo real, y señala que los flujos de trabajo fueron construidos por su propio equipo de capacidades, con respuestas de referencia producidas por modelos rivales. Nuestros propios datos de servicio de siete días sobre el mismo modelo sitúan la tasa de error en 0.49%, que es una medición diferente en una carga de trabajo diferente y es el contrapeso honesto a leer "cero" como un absoluto.

Lo que no han publicado

La arquitectura de Jev, su número de parámetros, su cómputo de entrenamiento y sus pesos no están publicados, y no hay ningún repositorio de pesos en la organización de GitHub de la empresa. Consultado el 2026-09-30, esa organización tiene once repositorios públicos; los sustanciales son herramientas, todos bajo MIT o Apache-2.0 — un repositorio de skills para agentes, un SDK de Python, un SDK de TypeScript, un adaptador de cliente drop-in respaldado por otras API de LLM, una colección de módulos de Dagger, algo de código publicado de evaluación de flujos de trabajo, un nodo de n8n y el propio sitio de la organización. Las cifras de estrellas y las fechas de push cambian, así que conviene consultarlas el día en cuestión en lugar de fiarse de esta página.

Tres de los once son forks de proyectos no relacionados: vLLM, LLaDA y un proveedor de Pulumi para ClickHouse Cloud. Son forks del trabajo de otra gente y no dicen nada sobre cómo se construye Jev; en particular, nada sobre que Jev esté basado en difusión. La respuesta en una línea a si Jev es de código abierto es que las herramientas son abiertas y el modelo no.

Lo que se conceden a sí mismos

Dos admisiones del post de lanzamiento valen más que la mayoría de las advertencias de los proveedores, porque nombran los lugares exactos donde la evidencia es débil. Sobre el precio: «No podemos probar que no esté subsidiado; necesitaremos el largo plazo para probar la sostenibilidad de nuestros precios (que esperamos que bajen, no que suban)». Sobre la velocidad: «nuestras evaluaciones publicadas generalmente se ejecutan desde nuestras laptops en la Costa Oeste (ahí es donde actualmente está basado nuestro servicio)». Hay una tercera, más útil para cualquiera que construya sobre esto: para conjuntos de opciones de alta cardinalidad, Jev ejecuta un sistema de dos etapas que puntúa de forma independiente y luego hace una elección explícita, «de ahí la ralentización ocasional». Eso es el proveedor explicando por qué la latencia no es uniforme entre tipos de preguntas, y es el tipo de cosa que normalmente se aprende en un hilo de soporte.

Dónde puedes llamarlo realmente, a día de hoy

A través de la propia API de TypeSafe, donde el modelo está disponible de forma general y la página de inicio todavía usa la frase del propio proveedor «early access» — esa redacción sigue vigente y vale la pena conservarla, mientras que «waitlisted» se ha retirado: la documentación publica límites operativos concretos (100K tokens por segundo, 40 solicitudes por segundo, 429 con retroceso del SDK al superar cualquiera de los dos) y no contiene ninguna referencia a listas de espera en absoluto. Y, desde el 24 de septiembre de 2026, a través de OrcaRouter.

Merece la pena decir con precisión qué ofrecemos, porque la forma de la llamada es la parte que cambia. La entrada del catálogo es typesafe/jev-1.13, llamada TypeSafe: Jev 1.13, con tipo de endpoint admitido "systemone" — por lo que se llega a él mediante POST /v1/systemone en lugar de la forma de chat-completions de OpenAI, sin streaming, entrada de texto y salida de JSON estructurado, hasta unos 64K tokens de entrada entre estado y preguntas combinados. La entrada cuesta $0.042 por millón de tokens y la salida se factura a cero, porque no hay tokens de salida que medir: una decisión tipada no es prosa. Ese es el precio de lista del proveedor trasladado tal cual, con 0% de margen, con la misma clave que los otros más de 200 modelos del catálogo — una API para más de 200 modelos, 0% de margen (precio de lista del proveedor trasladado tal cual, así que los recortes de precio del proveedor están vigentes aquí el mismo día). Si la razón por la que estás leyendo sobre TypeSafe AI es que quieres averiguar si la calibración de Jev se sostiene con tus propios datos antes de comprometer una ruta de producción con él, ejecutarlo junto a un modelo generativo en el que ya confías es la forma barata de averiguarlo; conmutar a ese modelo cuando la confianza de Jev resulta baja es la forma barata de ponerlo en producción.

Nuestras propias cifras de servicio de siete días para la ventana que finaliza el 2026-09-30, que son nuestros números de nuestro propio tráfico en lugar del benchmark del proveedor: p50 151 ms, p95 247 ms, aproximadamente 349 tokens de salida por segundo, una tasa de error del 0,49%, y 76,2 M de tokens servidos. El p50 diario a lo largo de esa ventana fue de 175, 170, 163, 161, 170, 147, 143 ms, por lo que la mediana ha estado descendiendo modestamente. Un día de la serie, el 09-28, tiene un p95 de 2.448 ms — un verdadero valor atípico en los datos, no la norma, y no un número sobre el que planificar un presupuesto de latencia. Estos se actualizan a diario; la tarjeta es la fuente.

A generated two-column figure card titled 'Jev 1.13 - the scoreboard', with the OrcaRouter logo composited in the bottom-right corner. The left column, headed 'LATENCY & RELIABILITY', lists 'p50 151 ms', 'p95 247 ms' and 'Error rate (7d) 0.49%'. The right column, headed 'PRICE & CONTEXT', lists 'Price $42 per billion input tokens', 'Context 65,536 tokens (32K state budget)' and 'Architecture & weights Unpublished'. A footer line reads 'Vendor figures unaudited; latency and error rate are OrcaRouter serving data, 7 days to 2026-09-30.'

Donde el modelo es débil, según TypeSafe

El proveedor publica una página de irregularidades para Jev 1.13, revisada por última vez el 2026-09-17, que nombra los modos de fallo con más franqueza que la mayoría del material de lanzamiento. Es la página adecuada para leer antes de construir sobre el modelo, y su propia lista es la siguiente. Jev responde a la pregunta que escribiste en lugar de a la que querías hacer, así que las palabras de alcance, las negaciones y las condiciones implícitas deben explicitarse. No es una calculadora: rinde peor en preguntas matemáticas que en semánticas. Lee las fechas como texto en lugar de como cantidades ordenadas, por lo que el orden, los huecos y la pertenencia a ventanas no son fiables, y empeora con formatos mixtos. Las dobles negaciones y la indirección de varios saltos reducen la precisión. La precisión cae a medida que el estado crece con detalle irrelevante —la página dice que "sufre de deterioro del contexto"—, así que filtrar en código primero es la solución. El estado se trata como datos, no como algo hostil por defecto, así que las instrucciones inyectadas pueden alterar las respuestas. Las instrucciones y los criterios desajustados lo confunden. No se garantizan las invariantes estructurales: un noul y una salida de opción no tienen por qué corresponderse, y una pregunta más su negación no tienen por qué sumar uno, así que los umbrales no deberían trasladarse entre ambas. Y no está entrenado para generar texto —forzarlo mediante opciones encadenadas "no funcionará bien y será muy lento".

A headless-browser capture of the TypeSafe model-jaggedness page for Jev 1.13, headed '# Jev 1.13 jaggedness' with the line 'Jev isn't perfect. Here are some jagged edges we are aware of with jev-1.13. Many of these will be fixed in later versions.' and the note 'Applies to jev-1.13 - Last reviewed 2026-09-17'. Below sits a table of nine documented failure modes - literal reading, math and numbers, date and time comparison, indirection, large state full of irrelevant detail, adversarial content, contradictory instructions and criteria, common-sense structural invariants, and generation - followed by explanatory body text on literal reading, counting and math.

Cómo interpretar a TypeSafe AI seis días después del cambio de enrutamiento

La empresa hace una afirmación fuerte, específica y falsable: que un modelo de decisión especializado puede ser más rápido, más barato y más fiable que uno general en el subconjunto de trabajo en el que necesitas un juicio y no un párrafo. La afirmación es plausible y en parte se evidencia por sí misma —las estimaciones de confianza son una diferencia de diseño real, el precio es real y la latencia que medimos en nuestro propio tráfico es del mismo orden que la del proveedor—. Lo que falta es la parte que permitiría a un externo verificar el resto: ni arquitectura, ni parámetros, ni pesos, ni benchmark independiente, y un precio que la propia empresa dice que no puede demostrar que sea sostenible. Los modos de fallo están documentados, lo cual es más de lo que hacen la mayoría de los laboratorios y es la mejor razón por sí sola para tomarse el modelo en serio.

Si estás decidiendo si prestar atención: ejecuta Jev sobre datos de entrada que ya tengas etiquetados, con las etiquetas ocultas, y observa si sus números de confianza separan los casos en los que acierta de aquellos en los que se equivoca. Esa prueba cuesta casi nada, a $0.042 por millón de tokens de entrada, y es la única que responde a la pregunta que realmente tienes. Si estás decidiendo si confiar en la empresa: las divulgaciones son lo que son, y la respuesta honesta es que la evidencia actualmente consiste en la palabra del proveedor más lo que generes tú mismo.