
Jev se niega a escribir una sola palabra: qué hace el modelo de decisión de TypeSafe AI y qué es lo que nadie ha verificado todavía
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
Jev es el primer modelo de TypeSafe AI que un lector probablemente conocerá a través de una tabla de costos y no de un cuadro de chat, porque no hay cuadro de chat. Lanzado el 15 de septiembre de 2026 por Diogo Almeida —coautor del artículo de InstructGPT, el trabajo que hizo que ChatGPT se comportara como un asistente—, Jev no genera texto en absoluto. Toma una pieza de estado (un correo electrónico, una línea de registro, un ticket de soporte, un blob JSON de coordenadas de juego) más una lista de preguntas tipadas, y devuelve respuestas tipadas: una elección de un conjunto que usted proporcionó, una puntuación según una rúbrica o una probabilidad de sí/no, cada una con su propio valor de confianza. Nada de prosa, nada de código, nada de explicaciones. La propuesta de TypeSafe es que esta estrechez es el producto, porque eso le aporta una velocidad y un precio que un modelo generativo no puede igualar —de 20 a 200 veces más rápido y de 40 a 400 veces más barato que "LLM comparables" en los propios materiales de lanzamiento de la empresa, a $0.042 por millón de tokens de entrada, con la salida facturada a cero.
El número más útil publicado en las primeras 48 horas no es uno de esos. Proviene de Every, cuyo responsable de evaluaciones pasó Jev por 27 artículos publicados de Every más 10 equivalentes con estilo de IA, planteando 21 preguntas a los 37 documentos a la vez: 777 juicios en menos de 0,7 segundos, por aproximadamente un cuarto de centavo. Una segunda prueba, realizada por el CEO de Every, sometió 12 pasajes sintéticos —seis limpios y seis con defectos plantados deliberadamente— a cuatro comprobaciones de escritura. Jev respondió con una mediana de 0,35 segundos por pasaje frente a los 8,83 segundos de Claude Fable 5.1 en esfuerzo alto: unas 25 veces más rápido y a aproximadamente 1/580 del coste. Detectó seis de los siete defectos plantados. Claude Fable 5.1 detectó los siete. El veredicto de Every fue «bueno, pero no perfecto», y esa es la lectura honesta en una línea de Jev a partir de la única prueba independiente que alguien ha publicado hasta ahora: las afirmaciones sobre velocidad y coste resisten el contacto con un tercero, la afirmación sobre precisión se sitúa un peldaño por debajo de la frontera, y la muestra es lo bastante pequeña como para que nadie debería sacar de ella una conclusión de producción.
Una nota sobre el tipo de evidencia con el que trabaja este artículo, porque los niveles están inusualmente alejados para un modelo tan nuevo. Jev es real y se puede invocar: hay un endpoint documentado, un SDK de Python, un alias de modelo y un precio publicado. El lanzamiento está anunciado por el proveedor, no filtrado, y nadie especula sobre si existe. Pero cada afirmación de rendimiento que TypeSafe presenta como principal es de TypeSafe, la arquitectura no está publicada, los pesos no se han publicado, y el panel de benchmarks detrás del titular de 20-200x es un conjunto de evaluaciones de flujos de trabajo internos en lugar de una tabla de clasificación pública. Una parte externa lo ha probado. Este artículo mantiene visibles y separados los números del proveedor, los números independientes y las preguntas abiertas, en vez de promediarlos en un consenso que no existe.
Lo que TypeSafe realmente lanzó
Jev es el primero de lo que TypeSafe denomina modelos System One —un nombre tomado de la mitad rápida e intuitiva de la cognición de Daniel Kahneman, en contraposición al modo deliberativo más lento que imitan los chatbots. El contraste que TypeSafe establece es con el patrón estándar de forzar a un generador de texto a emitir una salida estructurada y luego analizar ese texto de vuelta a algo en lo que el código pueda confiar. Jev se salta el texto por completo. La propia documentación de TypeSafe lo afirma sin rodeos: «Los grandes modelos de lenguaje (LLM) están diseñados para producir texto para que lo lean las personas. Cuando necesitas que un modelo emita un juicio que tu código consumirá, eso genera un desajuste.»
La superficie de salida son tres primitivas, y no hay nada más. Cada pregunta que hagas debe ser una de ellas:
Choice — elige una opción de una lista que tú proporciones, y devuelve la opción seleccionada junto con una probabilidad para cada candidato y un nivel de confianza. Las opciones están limitadas a 255 por campo; más allá de eso, TypeSafe documenta un patrón de dos etapas: puntuar los candidatos de forma independiente y luego elegir.
• Puntuar — situar el estado en una rúbrica ordenada, devolviendo el nivel, una probabilidad por nivel y una confianza. El riesgo de abandono en una escala de 0 a 1 es el ejemplo en la documentación.
• Noul — una palabra compuesta de "no" y "null" — una única afirmación de sí/no, que devuelve la probabilidad calibrada de que sea verdadera.

La propiedad interesante no es ningún primitivo en particular, sino cómo se componen. Los tres pueden combinarse en una sola llamada a la API, y cada pregunta se evalúa en paralelo contra una única lectura compartida del mismo estado. La documentación de TypeSafe dice que añadir preguntas "apenas cambia el tiempo de respuesta", y la prueba independiente lo respalda en la práctica: 21 preguntas en 37 documentos quedaron dentro de los mismos 0,7 segundos. Eso es lo que hace que el precio por juicio se desplome: no estás pagando por una generación más larga, estás pagando por una sola pasada.
Los límites prácticos, tal como se documentan y según lo reportado por los primeros usuarios: un presupuesto de aproximadamente 32.000 tokens por solicitud, descrito en la documentación de TypeSafe como unos 150.000 caracteres en inglés; sin entrada de imagen ni de audio en el lanzamiento; y una forma de solicitud y respuesta que no es la convención chat-completions de OpenAI, por lo que llamarlo requiere un cliente a medida en lugar de un simple cambio de URL base. El acceso consiste en una lista de espera de acceso anticipado más un playground en el navegador, con code>jev-latest/code> como alias del modelo.
RLCD significa calibrado, no preferido
TypeSafe entrena a Jev con un método al que llama RLCD — Reinforcement Learning for Calibrated Decisions, según la documentación de la propia empresa. El acrónimo es tan nuevo que la cobertura inicial lo ha expandido de forma inconsistente, así que vale la pena precisar qué designa en realidad, porque la distinción constituye toda la afirmación de la investigación.
RLHF optimiza para la salida preferida por los humanos. RLVR optimiza para la corrección verificable, del tipo que pasa los casos de prueba. RLCD optimiza para la calibración: un modelo que dice tener un 70 % de confianza debería acertar aproximadamente el 70 % de las veces. Ese es un objetivo distinto de acertar, y es la razón por la que cada respuesta de Jev se entrega con una distribución de probabilidad adjunta en lugar de solo una respuesta. El modo de fallo previsto es un modelo que sabe cuándo no sabe, para que tu código pueda decidir qué hacer al respecto.
Lo que eso te aporta en la práctica es una superficie de control. El patrón documentado consta de tres bandas de confianza —actuar automáticamente en la parte superior, marcar o confirmar en la intermedia, derivar a una persona en la inferior—, con los umbrales residiendo en tu código en lugar de en el modelo. Que las bandas sean honestas es una cuestión empírica sobre tus datos, y es una que TypeSafe te dice explícitamente que respondas tú mismo, señalando que los umbrales de confianza son específicos de cada caso de uso y deben probarse con tus propios ejemplos etiquetados. Esa instrucción es la frase más importante de la documentación, y la razón por la que existe la siguiente sección.
Los números, ordenados por quién los produjo
Aquí es donde la mayoría de la cobertura de Jev pierde rigor, así que vale la pena ser explícitos sobre la procedencia. Esto es lo que viene del proveedor, lo que vino de un evaluador independiente y lo que simplemente se desconoce.
• Informado por el proveedor, no reproducido — las afirmaciones destacadas sobre velocidad y coste. Latencia de extremo a extremo de 70-500 ms frente a 3-329 segundos para llamadas a LLM de frontera; 20-200 veces más rápido y 40-400 veces más barato; un único resultado de flujo de trabajo en el mejor de los casos anunciado como 193,6 veces más rápido y 444,6 veces más barato. TypeSafe reconoce que estas son cifras del mejor caso, no universales.
• Reportado por el proveedor, y verificable en la hoja de precios — $0.042 por millón de tokens de entrada, que son $42 por mil millones, con la salida gratuita. La razón de que la salida sea gratuita es mecánica en lugar de promocional: no hay decodificación autorregresiva que medir, así que no hay tokens de salida que facturar. Para ponerlo en perspectiva, los mismos materiales de lanzamiento sitúan el precio típico de entrada de los modelos de frontera entre $0.20 y $10 por millón, con la salida a menudo alrededor de cinco veces el precio de entrada.
• Informado por el proveedor, a partir de un benchmark interno — el propio panel de flujo de trabajo de TypeSafe, 711 casos en cuatro tareas, con respuestas de referencia derivadas del juicio promedio de GPT-6 Astra y Claude Fable 5.1 en lugar de la verdad fundamental. En ese panel, Jev se agrega en 67,8% frente al 74,1% del mejor comparador. Desglose: incidentes de seguridad 61,7% frente al 66,2% de Opus 5; observabilidad de rastreo de agentes 71,6% frente al 76,6%; procesamiento de facturas 61,8% frente al 79,1%; atención al cliente 76,0% frente al 78,3%. Jev gana las columnas de costo y latencia en ese gráfico y pierde la columna de precisión. El propio panel señala un posible sesgo del arnés, y TypeSafe ha dicho que omitió deliberadamente las tablas de clasificación públicas en favor de evaluaciones puntuales vinculadas a actualizaciones de producto.
• Medición independiente, muestra pequeña — las pruebas de Every descritas anteriormente: 777 juicios en menos de 0,7 segundos por aproximadamente un cuarto de centavo; 1.709 juicios en 11 experimentos por menos de un centavo en total; aproximadamente 25 veces más rápido y 1/580 del coste de Claude Fable 5.1 en una tarea de clasificación de 12 pasajes, aunque pasó por alto uno de los siete defectos implantados que el comparador sí detectó. La propia conclusión de Every fue que querría una comprobación de precisión mucho más exhaustiva antes de ponerlo en producción.
• Desconocido — la arquitectura. Sin paper en el lanzamiento, sin conteo de parámetros, sin divulgación del cómputo de entrenamiento, sin pesos. TypeSafe ha dicho que los detalles se mantienen "bajo reserva por ahora", con la posibilidad de un paper más adelante.

El patrón en esos niveles es consistente, y no es el patrón que sugiere el titular de 200x. Todas las cifras independientes y de proveedores coinciden en que Jev es dramáticamente más barato y dramáticamente más rápido. Ninguna cifra en ningún lugar, incluida la de la propia TypeSafe, muestra que sea más preciso que los modelos de frontera con los que se compara en precio. En el propio panel del proveedor, se sitúa alrededor del nivel de un buen modelo de gama media. La comparación que se sostiene no es "tan inteligente como un modelo de frontera por una centésima parte del precio" — es "cercano al juicio de un modelo de gama media a una fracción de centavo por llamada, lo bastante rápido para ejecutarse en cada turno".
Qué significa y qué no significa «cero alucinación»
Los materiales de lanzamiento de TypeSafe incluyen un gráfico que muestra una tasa de error del 0 % en llamadas a herramientas para Jev, frente a una tasa distinta de cero para los modelos de comparación, y la frase «resistente a las alucinaciones» acompaña al modelo. Ambas son ciertas y ambas son más limitadas de lo que parecen a simple vista.
La garantía es estructural. Todas las respuestas posibles se enumeran antes de que se ejecute el modelo —tú proporcionaste la lista de opciones, la rúbrica o la afirmación de verdadero/falso—, así que no hay espacio en el que emitir un valor fuera del tipo declarado. Una llamada de herramienta malformada no es algo que Jev pueda producir. Eso es una propiedad de ingeniería genuina y, para cualquiera que haya pasado una semana escribiendo lógica de reintentos en torno a fallos de análisis de JSON, vale dinero real.
No es una afirmación sobre ser correcto. Una respuesta válida según el esquema puede seguir siendo incorrecta: Jev puede enrutar con confianza una queja de facturación a la cola técnica, y la salida estará perfectamente bien formada aunque sea inútil. El propio Almeida ha dicho eso mismo, reconociendo que es posible estar equivocado con confianza. La forma útil de sostener ambos hechos es que Jev elimina la clase de error que proviene del formato de salida, y no hace absolutamente nada respecto a la clase que proviene del juicio. Lo que significa que la cuestión de la exactitud es por completo una cuestión de calibración, y la calibración es exactamente lo que tienes que medir tú mismo.
Cómo probar la afirmación de calibración con tus propios datos
La calibración es una de las pocas propiedades de un modelo que puedes comprobar correctamente con unos cientos de ejemplos y sin infraestructura de ML, y es la única prueba que importa antes de que Jev toque una ruta de producción. El procedimiento es breve.
Toma unos cientos de casos para los que ya tienes etiquetas. Hazle a Jev la pregunta que importa —la decisión de enrutamiento, la puntuación de riesgo, la comprobación de defectos— y agrupa las respuestas según la confianza que reportó. Luego comprueba si el grupo de confianza de 0.9 acierta aproximadamente el 90 % de las veces, el grupo de 0.7 aproximadamente el 70 %, y así sucesivamente. Un modelo bien calibrado traza una línea diagonal. Un modelo que únicamente se muestra confiado agrupa todo por encima de 0.9 y acierta el 70 % de las veces, y esa es la forma que rompe silenciosamente una canalización automatizada.
La misma prueba te indica qué umbrales usar. Si el intervalo de 0,9 es realmente preciso en un 90 % con tus datos, puedes automatizarlo. Si tu banda intermedia es una masa informe, la derivas a una persona o se la pasas a un modelo generativo y dejas que la ruta costosa se encargue de la ambigüedad. Esa división —modelo barato para la mayoría segura, modelo caro para el resto incierto— es la arquitectura real que Jev defiende, y es la razón por la que el modelo se entiende mejor como un componente que como un reemplazo.
Lo que cuesta, analizado en detalle
La estructura de precios es lo bastante sencilla como para razonar sobre ella, lo cual es poco común. La entrada cuesta $0.042 por millón de tokens. La salida es gratuita. Con el presupuesto de solicitudes documentado de aproximadamente 150.000 caracteres, una sola llamada de tamaño máximo cuesta bastante menos de un centavo.
Dos cifras reportadas dan una idea de la escala. Un usuario inicial ejecutó alrededor de 5.000 solicitudes por aproximadamente $2. La demostración de Doom —Jev dirigiendo un bot usando una descripción de texto del estado del juego en lugar de píxeles sin procesar— se ejecutó a unas 10 llamadas por segundo por aproximadamente $7 por hora. Y las 777 evaluaciones de Every en 37 documentos ascendieron a aproximadamente un cuarto de centavo, que es la cifra que hace legible el caso de uso interesante: a ese precio, revisar cada turno individual de un bucle de agente deja de ser una decisión de costo y se convierte en algo predeterminado.
Ese es el verdadero argumento a favor de Jev. Una pasada de verificación por turno —¿contradijo esta llamada de herramienta a la anterior?, ¿es esta salida coherente con la intención declarada del usuario?, ¿debería esto activar una alerta?— siempre ha sido técnicamente posible con un modelo de frontera y económicamente absurda a escala. A 0,042 dólares por millón de tokens y sin coste de salida, esa misma pasada pasa a ser asequible en cada turno. El valor aquí no es que Jev piense mejor que un modelo de frontera, porque no lo hace. El valor radica en que piensa de manera suficientemente barata y rápida como para ser consultado constantemente.
Vale la pena decirlo sin rodeos, porque es la siguiente pregunta obvia: OrcaRouter no sirve a Jev. El modelo de TypeSafe es de acceso anticipado, con lista de espera, y habla su propio formato de solicitud, así que cualquiera que lo pruebe pasa directamente por TypeSafe. Donde sí encaja una capa de enrutamiento es en la otra mitad del flujo de trabajo. El patrón para el que está diseñado Jev es el de dos modelos, no uno: Jev toma la decisión tipada, y un modelo generativo se encarga de la parte que necesita prosa, código o una explicación. Esa mitad generativa es la que cubre OrcaRouter: 197 modelos de 15 proveedores detrás de una sola clave compatible con OpenAI, al precio de lista del proveedor, traspasado con 0 % de margen, así que una rebaja de precio de un proveedor llega a nuestro lado el mismo día en que se lanza. Ambas mitades de un flujo de trabajo con forma de Jev se pueden probar sin un segundo contrato, y cuando el componente de decisión no está probado, la ruta de conmutación por error es lo que evita que un mal resultado de calibración se convierta en un incidente de producción.

Donde Jev no encaja
Las limitaciones están expuestas por el proveedor con una claridad inusual, lo que hace que esta sección sea fácil de escribir con honestidad. Jev no puede generar texto libre. No puede escribir código. No puede mantener una conversación. No tiene interfaz de chat, ni entrada de imágenes, y un presupuesto de contexto de alrededor de 32.000 tokens — un orden de magnitud por debajo de los modelos de contexto largo con los que se lo compara en precio. Los campos de selección tienen un límite de 255 opciones. Y la propiedad de «no alucinación», como se indicó antes, tiene que ver con el formato de salida más que con la verdad.
La red es un ajuste bastante estrecho. Bien: clasificación y enrutamiento de gran volumen, pases de guardarraíl y verificación, decisiones en las que la latencia es crítica, puntuación de grandes conjuntos de documentos en paralelo, cualquier situación en la que la respuesta correcta sea genuinamente una opción, un número en una escala o un booleano. Mal: generación abierta de cualquier tipo, razonamiento de contexto extenso, diálogo multiturno o cualquier tarea cuya respuesta correcta sea una oración. Si tu problema no se reduce a una pregunta tipada, Jev no es una forma más barata de resolverlo — no es una forma de resolverlo en absoluto.
También hay una crítica justa del enfoque que vale la pena retomar. Llamar a Jev un modelo de frontera toma prestada una credibilidad que el modelo no se ha ganado: no puede programar, conversar ni escribir una frase, y los gráficos comparativos se apoyan en modelos de frontera como línea base, mientras que la columna de precisión cuenta otra historia. La afirmación más defendible, y la que la evidencia realmente respalda, es que TypeSafe ha llevado mucho más lejos la frontera de velocidad y costo para decisiones estructuradas. Eso es algo sustancial que se ha logrado. Es algo distinto de construir un modelo que rivalice con GPT-6 Astra o Claude Fable 5.1.
¿Qué cambiaría esta imagen?
Tres cosas, en orden aproximado de cuánto importarían.
• Un artículo de arquitectura publicado o pesos abiertos. Todo sobre cómo Jev logra su velocidad es actualmente una caja negra, y la afirmación de que la evaluación en paralelo es el mecanismo —la analogía que traza Almeida es reemplazar la computación secuencial del mismo modo en que los transformers reemplazaron las redes recurrentes— es una aseveración más que un resultado demostrado. Hasta que se publique el diseño, la velocidad es un hecho y la explicación es marketing.
• Una segunda evaluación independiente con una muestra más grande. Las pruebas de Every son la evidencia más sólida de la que se dispone y abarcan 12 pasajes sobre la cuestión decisiva de la precisión. Una corrida independiente más, sobre unos cientos de casos etiquetados, permitiría zanjar si dejar pasar un defecto de cada siete era ruido o la tasa de error real.
• Una auditoría de calibración sobre entradas realistas y desordenadas. Todo lo publicado hasta ahora utiliza entornos de prueba limpios. La pregunta abierta para un modelo cuya propuesta de valor entera se basa en puntuaciones de confianza fiables es qué hacen esas puntuaciones en los casos genuinamente ambiguos, aquellos en los que un revisor humano también dudaría. Ese es el número que determina si es seguro automatizar con Jev, y nadie lo ha publicado.
Hasta entonces, la postura razonable es específica en lugar de general. Jev es un modelo real, ya lanzado, inusualmente barato, con una ventaja estructural genuina en la fiabilidad de salida, un perfil de precisión que se sitúa en torno a la gama media, y una afirmación de calibración que es plausible, recomendada explícitamente para autoevaluación por su propio proveedor, y validada de forma independiente solo en una muestra pequeña. Si tu flujo de trabajo tiene un paso que se reduce a una pregunta tipada que se hace con la suficiente frecuencia como para que un modelo de frontera sea un desperdicio, esta es una de las formas más baratas de hacerla — y el valor de confianza que devuelve es la parte que hay que probar antes de confiar en él, no la velocidad.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
