Una tarjeta de título generada encabezada por «System One, explicado», con el antetítulo «TYPESAFE SYSTEM ONE» y el subtítulo «Una categoría de modelo que devuelve decisiones tipadas en lugar de frases». Tres tarjetas a la derecha dicen «Dos preguntas, dos modelos», «Sin prosa de entrada, sin prosa de salida» y «Un valor sobre el que un programa puede ramificar». Una línea al pie dice «Jev 1.13 lanzado el 2026-09-15; invocable como typesafe/jev-1.13». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

"System One" como categoría de modelo: dónde se ubica Jev 1.13 dentro de ella

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

"System One" es el término de categoría que TypeSafe usa para su división entre un modelo que decide y un modelo que escribe, y Jev 1.13 (typesafe/jev-1.13) es su primer miembro: un modelo que devuelve respuestas tipadas en lugar de frases. No es un modelo nuevo. TypeSafe lanzó Jev el 15/09/2026, y esta página no es un artículo de lanzamiento: el modelo tiene quince días y queda fuera de la ventana de siete días para la que escribe este blog. Lo que ocurrió dentro de la ventana es que OrcaRouter añadió el modelo a su catálogo el 24/09/2026 y abrió la ficha del modelo de Jev 1.13 en https://www.orcarouter.ai/models/typesafe/jev-1.13 — la primera vez que se puede invocar a través de una pasarela de terceros en lugar de solo a través del endpoint propio de TypeSafe. La idea de categoría es la razón por la que existe esta página; el cambio de servicio es la razón por la que lleva la fecha de hoy.

La versión simple de la categoría: a un LLM se le hace una pregunta y escribe una respuesta para que la lea una persona. A un modelo System One se le hace una pregunta y devuelve un valor sobre el que un programa puede ramificar. La propia frase de TypeSafe es que «los LLM producen palabras para las personas», mientras que «Jev produce decisiones tipadas y se parece más al código: fiable, rápido, autoconsistente y de tipado seguro». Esa frase es toda la categoría comprimida en una sola cláusula, y vale la pena desglosarla despacio, porque los cuatro adjetivos hacen distintas cantidades de trabajo y uno de ellos hace más que los demás.

Lo que "más como código" realmente sostiene

Toma las cuatro afirmaciones en orden, porque no son cuatro reformulaciones de «es mejor».

• Fiable — la forma de la salida se fija de antemano. Tú declaras la pregunta; la respuesta solo puede volver como uno de los valores que permitiste. TypeSafe afirma sin rodeos que "el modelo nunca comete errores de tipo", y señala que esta es la única afirmación suya que es "matemáticamente imposible" de falsar con un contraejemplo, porque un valor que no está en tu conjunto declarado no es un valor que el modelo pueda emitir.

• Rápido — todas las respuestas se generan en una sola pasada en lugar de un token tras otro. La publicación de lanzamiento de TypeSafe lo expresa así: "Jev genera todas las probabilidades en paralelo en lugar de generarlas de forma autorregresiva token por token". En nuestra propia ventana de servicio de siete días que finaliza el 2026-09-30, la mediana del tiempo hasta el primer token en typesafe/jev-1.13 es de 151 ms y el p95 es de 247 ms.

• Autoconsistente — el mismo estado con las mismas preguntas tiende a producir las mismas respuestas. Una analogía con la programación es lo que hace que esto sea legible, pero también es donde la analogía deja de ser una prueba: el determinismo de un compilador es una propiedad de su construcción, mientras que esto es una afirmación sobre un comportamiento. Nuestras propias mediciones son la lectura honesta al respecto — la tasa de error en el tráfico de nuestro playground durante la misma ventana de siete días es del 0,49 %, así que es autoconsistente como una buena función es autoconsistente, no como lo es la aritmética.

• Seguridad de tipos — y esta es la que más peso tiene. «Seguridad de tipos» no es aquí un adjetivo de calidad; es una afirmación sobre dónde se sitúa el modelo con respecto a un verificador de tipos. En una canalización generativa ordinaria, el sistema de tipos empieza después de que el modelo termina: el modelo escribe texto, un analizador adivina la forma, un validador la comprueba y una ruta de fallo gestiona los casos en los que esa suposición fue errónea. Un modelo System One traslada la declaración de tipos a antes de la llamada. Las tres primitivas que documenta nuestra tarjeta son el sistema de tipos: noul, un juicio de verdadero/falso devuelto con una probabilidad calibrada; choice, una etiqueta elegida entre hasta 255 opciones etiquetadas; y score, una valoración en una escala ordenada de 2 a 10 niveles. Tú eliges la primitiva, aportas las etiquetas o los criterios, y el valor que devuelve procede de ese conjunto.

TypeSafe sí publica una diferencia entre su propia documentación y la nuestra que vale la pena señalar en lugar de resolver: la documentación del proveedor muestra un ejemplo de Score indexado desde cero, mientras que nuestra tarjeta documenta la escala como de 2 a 10 niveles. En ambos casos se describe el mismo primitivo. Si vas a construir un umbral, lee la página del proveedor para conocer la indexación exacta que usa tu SDK.

Los dos modos de fallo que dejan de existir

La consecuencia interesante de «sin prosa» no es estética. Es que los dos fallos que dominan los pipelines generativos de producción están ausentes de este diseño en lugar de verse mitigados por él.

La deriva de formato es la primera. Un LLM al que se le pide que devuelva JSON devuelve JSON la mayor parte del tiempo, y algo adyacente a JSON el resto del tiempo — un comentario final, una valla de markdown, un campo renombrado a un sinónimo, un objeto anidado donde el esquema quería una cadena. Las correcciones a nivel de prompt (instrucciones más estrictas, ejemplos few-shot, un esquema en el mensaje del sistema) son todos intentos de mantener una forma que el modelo es libre de abandonar, porque la forma es una solicitud, no una restricción. El planteamiento de TypeSafe hace explícito el contraste: con cadenas, se solicitan "posibles salidas y estructura" y las respuestas "deben ser analizadas + validadas", con "siempre cierto riesgo de que la IA se descarrile". Cuando las posibles salidas se declaran de antemano, la deriva no tiene a dónde ir.

La salida no analizable es la segunda, y en realidad es el mismo fallo en un momento peor: no un campo que volvió ligeramente incorrecto, sino una respuesta que el analizador no puede leer en absoluto, y que llega en el punto menos conveniente de un flujo de trabajo. Un modelo que emite un valor tipado no tiene tal estado.

Este es un argumento estructural, y debería presentarse como tal. No dice nada sobre si una respuesta individual es correcta — una pregunta de opción múltiple puede elegir la etiqueta equivocada, y un noul puede devolver verdadero con alta confianza cuando la respuesta honesta es falsa. Lo que desaparece es la categoría de fallo que un analizador sintáctico habría detectado. Esa es una reducción real y útil, y no es la misma afirmación que "las respuestas son correctas".

Por qué el precio es una forma, no un descuento

El modelo tiene un precio de $0.042 por millón de tokens de entrada, con la salida facturada a cero, y ese cero no es una tarifa promocional, sino un artefacto del diseño. Un modelo que emite tres tokens de respuesta estructurada no tiene volumen de salida que medir, así que la tarificación por token de salida no tiene a qué aplicarse. La forma de facturación es un cargo por token de entrada y una decisión. Nuestro catálogo traslada el precio de lista del proveedor con un margen del 0%, por lo que $0.042 es la cifra de TypeSafe y no una cifra que fijamos nosotros, y un cambio de precio del proveedor se aplicaría el mismo día.

Pon las dos formas una al lado de la otra y la diferencia no es un porcentaje. El costo de un pipeline generativo escala con cuánto dice el modelo: una respuesta verbosa cuesta más que una concisa para la misma decisión, y un modelo de razonamiento con cadena de pensamiento factura por los tokens que gasta pensando antes de responder, independientemente de si la respuesta mejora. El costo de una llamada a System One escala con cuánto le muestras: el estado y las preguntas. Haz una pregunta contra un documento largo y pagas por el documento. Empaqueta cuarenta preguntas contra el mismo estado (el presupuesto de entrada en nuestra ficha es de 65,536 tokens entre el estado y las preguntas combinados, aproximadamente 64K; si has visto una cifra de "aproximadamente 32,000 tokens" en artículos anteriores de OrcaRouter, ese es el presupuesto de estado por sí solo, no un total competidor) y pagas por el documento una vez y obtienes cuarenta decisiones de vuelta.

Por eso el costo por decisión, y no el costo por token, es la unidad correcta para esta clase de problemas, y por eso el medidor corre en dirección opuesta a lo que la mayoría de los equipos espera. La típica medida generativa para reducir costos es "hacer que el modelo diga menos". Aquí no hay nada de lo que decir menos.

A headless-browser capture of the OrcaRouter model card for TypeSafe: Jev 1.13 at orcarouter.ai/models/typesafe/jev-1.13. The header reads 'Jev 1.13' with the badge '65K tokens', the slug typesafe/jev-1.13, the byline 'by TypeSafe - 2026-09-24', and the summary 'TypeSafe's structured decision and evaluation model... Served via POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.' A stats row reads '$0.04  151 ms  247 ms  76.2M', above a code sample pointing at https://api.orcarouter.ai/v1/systemone with "model": "typesafe/jev-1.13", and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

Los propios números de TypeSafe, que son reportados por el proveedor y no han sido replicados de forma independiente, apuntan directamente a esa comparación: «193,6 veces más rápido, 444,6 veces más barato», con una nota al pie que dice «basado en flujos de trabajo para tareas de System One (prueba)», y con un ejemplo desarrollado que dice «TypeSafe AI Coste $0,000081 Completado en 0,114 s / LLMs Coste $0,013880 Completado en 8,566 s». La página de inicio también indica «$42 por mil millones de tokens de entrada» frente a «un precio de entrada 238 veces menor que Claude Fable 5.1». Tómese todo ello como el argumento del proveedor, no como un resultado medido: la publicación de lanzamiento admite que «nuestras evaluaciones publicadas generalmente se ejecutan desde nuestros portátiles en la costa oeste» y que «no podemos demostrar que no esté subsidiado; necesitaremos el largo plazo para demostrar la sostenibilidad de nuestros precios (que esperamos que bajen, no que suban)». Esas dos concesiones son del propio proveedor, y son el marco correcto para cada multiplicador de la página.

La calibración es la segunda mitad de la idea

Si la categoría fuera solo "salida estructurada", describiría la llamada a funciones con pasos adicionales. Lo que la hace única es que cada respuesta llega con una probabilidad, y las probabilidades son el objetivo de entrenamiento. TypeSafe llama al método Reinforcement Learning for Calibrated Decisions (RLCD) —su término, no un acrónimo genérico—, y la tabla comparativa de la publicación de lanzamiento lo sitúa junto a RLHF y RLVR: RLHF optimiza lo que prefieren los evaluadores humanos, RLVR para salidas que se pueden comprobar programáticamente, y RLCD para "respuestas con probabilidades epistémicamente honestas en tareas de System One".

La diferencia práctica es para qué sirve la probabilidad. En un pipeline generativo, la estimación de confianza es una segunda generación: le preguntas al modelo cuán seguro está y escribe un número, que en sí mismo es prosa con los mismos modos de fallo. Aquí la probabilidad viene con la decisión, en la misma pasada, y es aquello sobre lo que bifurcas. El propio planteamiento de TypeSafe sobre el beneficio es que un modelo que puede hacer una tarea el 95% de las veces pero que "no dice cuándo está en el 5%" no se puede usar para automatizar la tarea; la confianza te da un lugar donde poner el escalado, a una persona o a un modelo de razonamiento.

La página de inicio de TypeSafe lo presenta como “Cero alucinaciones”, y explica que cada decisión conlleva una estimación de confianza para que el software pueda “actuar cuando la confianza es alta y escalar cuando no lo es”. Léelo con atención: es una afirmación sobre estimaciones de confianza, no una afirmación de que ninguna respuesta sea incorrecta alguna vez. Nuestra propia tarjeta es el contrapeso: una tasa de error del 0,49 % durante los siete días que terminaron el 2026-09-30, en nuestro tráfico, medida por nosotros. Esa cifra es una ventana móvil, no un conjunto de pruebas fijo: unos días antes, en la misma ventana, marcaba 0,57 %, y volverá a moverse.

Donde System One se encuentra junto a System Two

El vocabulario rápido/lento es muy anterior a TypeSafe. Proviene de Pensar rápido, pensar despacio, de Kahneman, y ha sido tomado prestado por investigadores de IA durante años antes de esto: la etiqueta "Sistema 2" se aplicó a los modelos de cadena de pensamiento y razonamiento deliberado mucho antes de que TypeSafe existiera, y TypeSafe no afirma haber acuñado ninguno de los dos términos. Lo que han hecho es aplicar la distinción a una frontera de producto en lugar de a un modo de prompting.

• Un modelo de razonamiento de Sistema Dos gasta más cómputo antes de responder y mejora en los problemas que lo necesitan. Su salida sigue siendo prosa, y el cómputo adicional se factura como tokens de salida.

• Un modelo de Sistema 1 en el sentido de TypeSafe no piensa más tiempo para responder mejor. Responde en una sola pasada, y lo que sacrifica por la velocidad es la capacidad de producir algo que no sea un valor tipado.

• Los dos son complementos en un flujo de trabajo, no rivales en una comparación. Una llamada a System One maneja las decisiones que tienen que ser rápidas, baratas y legibles; el modelo de razonamiento recibe los casos que la puntuación de confianza marcó como inciertos. La salida tipada es lo que hace que el traspaso sea limpio — estás pasando un valor y una probabilidad a la siguiente etapa, no una frase para volver a analizar.

Donde el vocabulario se vuelve resbaladizo es al tratar «modelo System One» como una categoría establecida que otros proveedores han adoptado. No hay evidencia de eso, y esta página no debe leerse como si lo afirmara. TypeSafe usa el término para su propia clase de modelos; la advertencia en nuestra propia ficha dice lo mismo por omisión, al enumerar un único tipo de endpoint para un único modelo. Si otro laboratorio empieza a usar la frase para la misma arquitectura, eso será un hecho que valdrá la pena reportar y necesitará sus propias palabras para reportarlo.

A headless-browser capture of the TypeSafe blog post announcing System One models. The masthead reads 'TypeSafe AI | Manifesto | Our Team | Docs | Contact Sales', under the section heading 'Company News' with the date 'Sep 15, 2026' and the byline 'Diogo Almeida, founder, TypeSafe'. The opening paragraph asks 'Models have been superhuman at chat for years, so where is all the automation?', followed by 'After two years in stealth... I am beyond excited to announce that today, TypeSafe AI is releasing our first System One Model: a new class of frontier models built to make fast, structured decisions that software can use directly.' A later paragraph reads 'Our first public model is Jev, available today in early access.'

Nuestra tarjeta también enumera la irregularidad como parte del límite honesto en lugar de como una sorpresa: nueve modos de fallo con nombre. Las entradas de lectura literal e indirección son las que se derivan directamente de la analogía de «más como código»: un modelo que responde a la pregunta que escribiste en lugar de a la que querías hacer se comporta como una función que hizo exactamente lo que decía el código. La entrada sobre el conteo no lo hace. Un modelo que «reconoce la forma de una respuesta en lugar de contarla» no se parece en nada al código, y por eso la propia recomendación de TypeSafe es contar en código y, cuando de verdad se necesita un juicio, hacer una pregunta por elemento y sumar las respuestas tú mismo.

Dos límites que moldean el diseño, no la puntuación

Ambos vienen del mismo lugar: sin cadenas no hay nada que transmitir ni nada que enviar por partes.

• Sin streaming — la primera salida es la respuesta ya terminada, de modo que una llamada de System One es una sola respuesta, no un flujo continuo. La pregunta no es si puede emitir en streaming, sino qué emitiría.

• Una sola forma de solicitud — el modelo se sirve a través de POST /v1/systemone en nuestro catálogo en lugar de la forma de chat-completions, y esa es la versión honesta de una afirmación anterior de que "habla su propia forma de solicitud". Es una diferencia real en cómo lo llamas: entran un objeto de estado y un mapa de preguntas con nombre; sale una respuesta estructurada por pregunta. Escribirás un mapeador para ello y, como la salida está tipada, el mapeador es toda la integración: no hay ninguna capa de parseo defensivo por debajo.

Vale la pena saberlo antes de hacer una prueba de carga: la latencia no es uniforme entre tipos de pregunta. TypeSafe explica por qué, en sus propias palabras: "Para elecciones de mayor cardinalidad, hacemos un sistema de 2 etapas de puntuación independiente y luego tomamos una decisión explícita, de ahí la ralentización ocasional". Una decisión de enrutamiento de 4 opciones y una clasificación de 200 opciones son la misma primitiva sobre el papel y cantidades distintas de trabajo en la práctica. Nuestras medianas diarias durante los siete días que terminan el 2026-09-30 son 175, 170, 163, 161, 170, 147, 143 ms. Un día de esa serie, el 2026-09-28, tuvo un p95 de 2,448 ms — un valor atípico real de un solo día que se integra honestamente en la serie, pero no es la forma del servicio.

A generated single-column scoreboard titled 'Jev 1.13 - the scoreboard' with six rows: 'Median time to first token: 151 ms', 'p95 time to first token: 247 ms', 'Error rate, seven days: 0.49%', 'Input price: $0.042 / M tokens', 'Output billing: $0.000000 / M tokens' and 'Endpoint: POST /v1/systemone', plus a footer reading 'Serving figures: OrcaRouter Playground, seven days ending 2026-09-30. Price per the OrcaRouter catalogue; TypeSafe's own speed and cost multipliers are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

Lo otro que hay que saber antes de una primera integración es a qué te estás conectando. Las herramientas en torno a Jev son de código abierto bajo licencias MIT y Apache-2.0 — los SDK de Python y JavaScript, un adaptador que presenta el mismo cliente respaldado por API de LLM ordinarias, el código de workflow-evals y un conjunto de habilidades de agente, todo en los repositorios públicos de TypeSafe, con recuentos de estrellas y fechas de push que se movieron tan recientemente como el 2026-09-26 y el 2026-09-29. El modelo no. No hay repositorio de pesos: la arquitectura de Jev, el recuento de parámetros, el cómputo de entrenamiento y los pesos no están publicados, y un lector que lo compruebe no debería dejarse engañar por los tres repositorios de esa organización que son bifurcaciones de proyectos no relacionados — una bifurcación de vLLM, un lanzamiento de modelo de lenguaje de difusión de 2025 y un proveedor de Pulumi. Ninguno de ellos dice nada sobre cómo está construido Jev. La respuesta en una línea es que las herramientas son abiertas y el modelo no.

Ejecutándolo hoy, y qué cambia para un lector

Jev 1.13 está en OrcaRouter como typesafe/jev-1.13, accesible con la misma clave que más de 200 otros modelos, con el precio de lista del proveedor trasladado con un 0 % de recargo. El valor práctico de eso en una página sobre una categoría es limitado y merece decirse con exactitud: probar un modelo de System One ya no requiere una cuenta aparte, una clave aparte y una factura aparte para un modelo que quizá todavía no sabes que quieres. Se sitúa junto a la mitad generativa del mismo flujo de trabajo: el clasificador y el redactor con una sola credencial, en un solo lugar, con el recuento de lo que realmente invocaste.

Nada de esto cambia lo que es el modelo. Se lanzó el 15 de septiembre de 2026 y TypeSafe todavía lo describe como acceso anticipado; lo que es no ha cambiado desde entonces. Lo que cambió el 24 de septiembre de 2026 es que ahora un lector puede averiguar cuánto le cuesta en la práctica sin comprometerse primero con una segunda relación con un proveedor. Si has estado esperando para ver si la categoría merece un prototipo, eso es lo que se movió.